Retour au fil

27 milliards de paramètres dans une main : comment le Khadas Mind Pro a atteint 44 jetons/s

Le Khadas Mind Pro a exécuté Qwen3 27B dans une main sur Panther Lake Core Ultra X7 358H et ARC B390 ; avec la bonne quantification et le bon modèle de brouillon, la même machine est passée de 5 tok/s à 44 tok/s, un bond de 9x.

Importé dans Nodesdaily : (UTC+03:00)
Voir sur YouTube — 1_8pzU44n-M
Options de lecture

La lecture vocale n’est pas disponible dans ce navigateur.

Loupe à concepts

Choisissez un terme technique de cette vue pour lire sa définition générale, un exemple pédagogique et son usage dans l’article.

Aucun terme de notre glossaire n’a été trouvé dans cette vue. Le glossaire ne couvre pas encore tous les termes.

Tout a commencé par une simple curiosité : une machine qui tient dans une main peut-elle réellement exécuter un modèle d'IA sérieux ? La réponse est oui, mais ce n'est pas la surprise. Sur le même Khadas Mind Pro et le même Qwen3 27B, le réglage le plus lent rampait en dessous de 5 tok/s tandis que le plus rapide atteignait 44 tok/s ; le traitement des invites a bondi de 56x, passant de 17 à plus de 900. La différence n'était pas un nouveau matériel, mais les bons réglages logiciels.

La machine est le Khadas Mind Pro. À l'intérieur se trouve l'Intel Panther Lake Core Ultra X7 358H : 16 cœurs hybrides, 12 graphiques intégrés ARC B390 basés sur Xe3, 64 Go de LPDDR5X à 8533 MT/s, plus un SSD PCIe 4.0 de 2 To. Intel positionne la plateforme pour jusqu'à 180 TOPS d'IA locale. Notebookcheck a constaté des performances CPU très élevées et un iGPU 60 à 80 % plus puissant que les générations précédentes, le bloc graphique consommant 30 à 40 W dans un boîtier de 50 W. Présenté au CES 2026, c'est le plus petit boîtier X7 que l'entreprise ait fabriqué.

L'astuce est la modularité. Le Mind Link de Khadas est un connecteur magnétique propriétaire qui fixe la machine à une station d'accueil et expose un lien PCIe 4.0 x8 natif, théoriquement 15,8 Go/s. La station d'accueil Mind Graphics 2 abrite une carte graphique de bureau NVIDIA RTX 5060 Ti 16 Go GDDR7, un GPU de 180 W avec une alimentation de 350 W. Elle ajoute également deux HDMI 2.1b, DisplayPort 2.1b, deux USB-A 3.2 Gen2, un USB-C 40 Gbps, un 2.5 GbE et un lecteur SD 4.0. Les prix sont élevés : la machine commence à 1 799 dollars et a récemment grimpé à 2 599, la station d'accueil coûte 1 349 ; la carte seule coûte environ 570. Le lien dépasse de loin le plafond de 80 Gbps de Thunderbolt 5, mais l'importance de cette vitesse est une autre question.

La charge était Qwen3 27B, un modèle ouvert populaire de 27 milliards de paramètres. Le premier pack était Q4_K_M : 4 bits avec K pour le nouveau schéma de mise à l'échelle et M pour une protection moyenne, pesant 17,66 Go. Le second était IQ4_XS : toujours 4 bits mais plus compact avec une calibration imatrix, descendant à 13 Go et tenant entièrement dans 16 Go de VRAM. Le modèle n'est pas un bloc mais un gâteau d'environ 62 couches ; le drapeau NGL de llama.cpp décide combien de couches sont copiées dans la VRAM. Les packs GGUF d'Unsloth sur Hugging Face montrent l'écart pratique entre les deux compressions.

Sans station d'accueil, la machine fonctionne de quatre manières : CPU, Vulkan, SYCL et OpenVINO. Le traitement des invites mesuré était de 17 tok/s sur CPU et 446 tok/s avec OpenVINO, un écart de 27x. La génération était bloquée entre 2,6 et 5,7 tok/s : CPU en dessous de cinq, Vulkan 5,4, SYCL 5,7, OpenVINO 2,6. La raison est la mémoire : chaque jeton diffuse les 18 Go de poids, et les graphiques intégrés partagent un pool avec le CPU. La bande passante réelle est inférieure aux calculs : 17,66 Go multipliés par 5,42 tok/s équivalent à environ 100 Go/s. Le nouveau pilote d'Intel peut ouvrir la mémoire partagée à 93 %, mais il s'agit toujours de DDR partagée à la vitesse du système, pas de VRAM dédiée ; le goulot d'étranglement demeure.

La solution est d'arrêter de produire un mot par passe. Le décodage spéculatif utilise un petit modèle de brouillon rapide qui devine quelques jetons à l'avance ; le grand modèle les vérifie en une seule passe et chaque supposition acceptée est presque gratuite. Certains packs Qwen livrent le brouillon de 1,5 Go juste à côté du modèle. Sur les graphiques intégrés, cela a doublé la sortie de 5 à 11 tok/s gratuitement. Les deux appareils ont atteint un pic à une profondeur de brouillon Nmax 3, même si l'un est cinq fois plus rapide. Pousser à Nmax 8 a fait chuter à 3,5 tok/s, plus lent que sans brouillon du tout. llama.cpp par défaut est déjà à 3, alors laissez-le tel quel.

L'ajout du GPU discret est devenu délicat. À 17,6 Go, le modèle a débordé la carte de 16 Go de 1,7 Go. Le balayage NGL a raconté l'histoire : 0 couches 4,54 tok/s, 48 couches près de 11, 56 couches près de 14, puis 60 couches se sont effondrées à 0,82 tok/s, une chute de 17x et un mur. Ces quatre couches supplémentaires ont forcé le pilote à échanger les couches pour chaque mot. L'ancien drapeau tutoriel NGL 99 annule l'ajustement automatique ; l'auto a donné 10,48 tok/s tandis que le réglage manuel 56 a donné 14, donc le drapeau aveugle peut coûter 16x. La courbe n'est pas une pente douce mais une falaise qui ne se libère qu'à la dernière étape ; les dernières couches comptent le plus.

La solution a été de réduire le modèle. Le passage de Q4_K_M à IQ4_XS a économisé 4,5 Go et l'a rendu entièrement résident en 16 Go. Le gain a été double : traitement des invites de 474 à 943, génération de 14 à 27. Un téléchargement a battu tout le balayage des couches. La qualité a-t-elle baissé ? Sur la prose anglaise de WikiText-2, la perplexité est restée autour de 6,8 pour les deux packs, le plus petit étant même un peu meilleur, dans le bruit. Mais la limite est claire : les deux fichiers provenaient de quantificateurs différents, donc le test a comparé ces fichiers, pas Q4 versus IQ4 en général ; et la perplexité ne vérifie que la prédiction du jeton suivant sur la prose, pas le code, les maths ou le raisonnement long. Testez votre propre charge de travail.

Le Mind Link est-il vraiment important ? Sur le papier, c'est un tuyau de 15,8 Go/s ; en pratique, la génération nécessite 2 à 19 Mo/s et une moyenne de 2 Mo/s, soit environ 0,01 % du tuyau. Il faudrait rendre le lien 8 000 fois plus lent avant qu'il ne devienne le goulot d'étranglement. Thunderbolt est cinq fois plus lent sur le papier, mais cinq contre 8 000 n'est pas proche. Pour la génération LLM, cela ne fait aucune différence ; pour les jeux, cela pourrait. Le seul moment où la bande passante compte est le chargement : déplacer 17 Go en environ 3 secondes est un mouvement de données réel, puis la carte reste presque inactive.

Les mesures ont été perdues pendant une journée entière parce qu'un processus invisible retenait 18,5 Go en otage ; llama-bench est resté résident après l'arrêt et chaque lecture ultérieure a été divisée par deux sans avertissement. Avec un deuxième GPU présent, OpenVINO est silencieusement revenu au CPU et a causé une erreur 30x ; la variable d'environnement veut GPU.0 avec le zéro. La machine a une batterie UPS intégrée ; sous forte charge, un câble de 30 W l'a lentement déchargée jusqu'à l'arrêt, résolu avec un câble de 100 W. Une station d'accueil Austar OCuLink a planté deux fois lors du déplacement du modèle vers la VRAM, le pilote d'affichage a abandonné. Linux n'a pas encore été testé par crainte du pilote de lien spécial. La vidéo raconte ces pièges exprès pour que vous ne tombiez pas dedans.

Mettez tous les réglages côte à côte et l'image est nette : CPU seul en dessous de cinq, intégré 5,5, plus brouillon 11, discret divisé 14, entièrement résident 27, plus brouillon 44 tok/s ; neuf fois du plus lent au plus rapide. Le traitement des invites est passé de 17 à plus de 900, 56x. Trois victoires sont gratuites : faites-le tenir, activez le brouillon, supprimez le drapeau tutoriel. Une seule victoire coûte de l'argent : achetez de la VRAM. La leçon est d'acheter de la VRAM, pas de la bande passante ; vérifiez l'ajustement avant d'acheter, ne collez pas NGL 99 aveuglément, et n'activez le brouillon que pour une machine mono-utilisateur ; avec deux utilisateurs, désactivez-le car les suppositions sont en concurrence avec les utilisateurs réels pour la même passe.

Visualization: nodesdaily AI

Commentaire de l’IA

"« Ce qui m'a surpris, ce n'est pas qu'il fonctionne, mais que le même matériel aille 9 fois plus vite avec les bons réglages ; le fait de tenir dans la VRAM a été le facteur décisif entre l'arrêt et la vitesse. »"

Évaluation de l’IA

En étant objectif, le contre-argument est solide : une machine de poche plus une station d'accueil à mille dollars dépasse les trois mille et même à 44 tok/s, une API cloud est toujours plus rapide et moins chère ; pour 10-20 dollars par mois, vous pouvez passer de GPT à Claude et Gemini, donc cela reste un passe-temps de niche. L'ARC B390 rivalise avec une RTX 4050 Laptop de 60W dans les jeux mais n'est pas un champion du rapport prix-performance ; comme le note Notebookcheck, la RAM est soudée, les mises à niveau sont minimales et les accessoires sont chers. L'échelle et la fraîcheur du cloud ne sont pas battues par ce seul bureau.

Beaucoup de choses n'ont pas été testées. La perplexité ne vérifie que la prédiction du jeton suivant sur la prose anglaise ; les dommages au code, aux mathématiques et au raisonnement long restent invisibles, pourtant c'est pourquoi beaucoup exécutent un 27B localement. Le throttling thermique, le bruit du ventilateur, l'autonomie de la batterie et la configuration maximale de 96 Go n'ont jamais été mesurés. Un modèle, deux fichiers, deux quantificateurs est trop étroit pour une affirmation générale. La note selon laquelle un brouillon nuit avec deux utilisateurs simultanés parce que les suppositions sont en concurrence avec les utilisateurs réels pour la même passe n'a pas été évaluée ; Linux reste une question ouverte.

En ce qui concerne la vérifiabilité, je reste prudent : la vidéo n'est pas sponsorisée par Khadas mais c'est une vitrine de produit et elle contient une publicité pour Abacus ChatLM ; les chiffres sont pour un seul appareil, une seule exécution. L'affirmation de 44 tok/s nécessite IQ4_XS entièrement résident plus le brouillon et son taux d'acceptation varie avec l'invite ; elle nécessite une nouvelle exécution indépendante. Les prix sont également volatils : la machine est passée de 1 799 à 2 599, la station d'accueil coûte 1 349 ; le déverrouillage de la mémoire partagée à 93 % est une flexibilité de capacité, pas de vitesse, et la bande passante partagée ne peut toujours pas égaler la VRAM dédiée sous forte charge. Le titre de 93 % de TopCPU concerne la capacité, pas la performance.

Mon avis est pratique : si la confidentialité et l'utilisation hors ligne sont ma priorité et que mon modèle tient dans 16 Go, cette machine devient une station de bureau sensée ; si j'ai besoin d'un contexte long, d'une qualité supérieure ou d'un partage d'équipe, l'API cloud est toujours plus saine et moins chère. Avant d'acheter, vérifiez que votre modèle tient, ne rejetez pas aveuglément la quantification lourde mais testez-la sur votre propre charge de travail, supprimez NGL 99 et laissez l'ajustement automatique s'exécuter ou essayez un réglage manuel autour de 56, et restez à Nmax 3. J'utiliserais cette configuration pour un assistant de codage mono-utilisateur et désactiverais le brouillon sur un serveur multi-utilisateurs.

Sources

10 liens ; 1 d’entre eux sont aussi cités par 2 autres articles. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

khadas · panther lake · arc b390 · qwen3 · quantification · llama.cpp · vram

Suivre le sujet

Avant cet article

Un court ordre de lecture des articles antérieurs reliés à cet événement par un éditeur.

Preuves et sources

Consultez les passages autorisés, leurs versions et leur origine.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…