Retour au fil

125 milliards de paramètres à la maison : comment Strata atteint 93 jetons par seconde sur 12 Go

Strata, un nouveau moteur d'inference, fait tourner Qwen 3.8 Flash-Next, 125 milliards de paramètres, à 93 jetons par seconde sur une carte de jeu de 12 Go. La version honnête du titre 6x est 2 à 2,5x, et la vraie limite n'est pas la carte graphique mais 64 Go de mémoire système.

Importé dans Nodesdaily : (UTC+03:00)
Voir sur YouTube — m0VHx73SAG0
Options de lecture

La lecture vocale n’est pas disponible dans ce navigateur.

Loupe à concepts

Choisissez un terme technique de cette vue pour lire sa définition générale, un exemple pédagogique et son usage dans l’article.

Aucun terme de notre glossaire n’a été trouvé dans cette vue. Le glossaire ne couvre pas encore tous les termes.

Regarder un curseur tourner pendant trois minutes pendant que les ventilateurs hurlent et qu'un modèle géant produit un seul mot : voilà le présentateur il y a quelques semaines. Un week-end passé à faire tourner un modèle de 125 milliards de paramètres sur un PC domestique avec llama.cpp, récompensé par 15 jetons par seconde les bons jours et des attentes de plus de trois minutes avant le premier mot sur les longues requêtes. Puis Strata est apparu sur GitHub le 24 septembre, avec des chiffres comme 93 jetons par seconde sur une carte de 12 gigaoctets qui ont fait le tour. Cela ressemble au calcul de miniature classique au premier regard, mais une fois que l'architecture interne du modèle devient nette, cela devient un récit d'ingénierie à prendre au sérieux.

En pleine précision, Qwen 3.8 Flash-Next est un modèle de 354 Go, environ 29 fois la mémoire de la carte qui l'exécute, comme enfiler un paquebot par une fenêtre de cuisine. Pourtant Strata s'installe d'un double-clic sur Windows ou d'un seul script sur Linux, trouve les fichiers adaptés au système, télécharge environ 70 Go et ouvre une fenêtre de discussion. Le même moteur expose les mêmes points d'API qu'OpenAI et Anthropic, si bien que des outils comme Claude Code peuvent viser directement la machine locale. Le projet a rassemblé près de 4900 étoiles en huit jours, avec des fils de forum pleins d'utilisateurs publiant leurs propres chiffres de vitesse. Captures et tableaux de vitesse sont publiés dans le dépôt du projet Strata sur GitHub, dont les chiffres README montrent 94 jetons par seconde sur 12 Go avec la version Q2_0.

125 milliards de paramètres ne lisant que 4 Go par jeton

Contrairement à ce que la plupart supposent, un modèle de 125 milliards de paramètres ne touche pas 125 milliards de paramètres par mot. La version Q2 2 bits que Strata exécute le plus vite est un fichier de 66 Go, dont la moitié environ consiste en experts, de petits modules spécialisés. Chacune des 48 couches du modèle contient 512 experts, 24576 blocs au total, et par jeton chaque couche n'en choisit que 10 sur 512 plus un partagé. Sur toutes les couches, 480 experts travaillent par jeton, environ deux pour cent du total. Sur 34 Go de données d'experts, un seul jeton lit environ 0,66 Go, et avec les parties toujours actives le total touché n'est que de 4 Go sur un fichier de 66 Go. Les chiffres 125B de paramètres et 6B actifs de cette conception mélange-d'experts se vérifient sur la page Qwen de HuggingFace.

Près de la moitié du fichier, une portion de 29 Go, est une seule table de recherche de 51 milliards de paramètres indexée par les trois derniers jetons vus par le modèle. Comme le modèle sait exactement quelles lignes il lui faudra avant d'en avoir besoin, Strata laisse simplement toute la table sur le SSD et ne lit que 16 lignes par jeton, environ 23 kilooctets. Le point frappant est que l'équipe Qwen a conçu ce modèle exactement pour cet usage : la fiche du modèle dit que la structure d'enrobage se prête particulièrement au déport. Trente-six des 48 couches utilisent un type d'attention à mémoire constante quelle que soit la longueur de la conversation, tandis que les 12 restantes ne regardent pas plus de 48 positions en arrière. Ces quatre innovations sont décrites dans les mêmes termes dans le dépôt Qwen sur GitHub et dans l'article d'architecture d'AlibabaCloud, et l'équipe Qwen compte ce modèle comme un aperçu de l'effort Qwen4.

Quand un jeton est généré, chacune des 48 couches confie deux tâches à la carte graphique : le mécanisme d'attention et un routeur qui choisit les 10 experts dont ce jeton a besoin. Une fois la liste établie, la carte vérifie lesquels de ces experts elle garde déjà en mémoire ; une carte de 12 Go en conserve environ 4500 sur 24576. Ceux qu'elle détient tournent aussitôt sur le GPU pendant que les manquants sont calculés en même temps par le CPU en mémoire système, puis la carte rassemble les deux résultats, les additionne et passe à la couche suivante. Sur la machine de test, un tour complet prend environ 34 millisecondes, 15 pour le GPU et 13 pour le CPU, si bien que les deux processeurs travaillent vraiment en parallèle, s'attendant l'un l'autre à chaque couche. Les 4500 experts en cache ne sont pas tirés au hasard ; ils se chargent depuis un profil, un relevé des experts les plus utilisés sur de nombreuses conversations. Servant environ la moitié de toutes les lectures d'experts dès le premier message, le cache grimpe vers 72 pour cent de succès à mesure que Strata apprend ce que la conversation courante redemande. Ce cache d'experts est tout le moteur ; là où les moteurs anciens traitent la mémoire de la carte comme la ressource rare et la RAM système comme un dernier recours, Strata fait tourner les deux comme des joueurs égaux.

Le coeur du moteur : cache d'experts et couche de brouillon

La seconde astuce, derrière une grande part des gains réels, est une petite couche de prédiction entraînée aux côtés du modèle principal. Fonctionnant comme un brouillon bon marché et rapide, cette couche devine jusqu'à trois jetons d'avance, puis le grand modèle exécute les 48 couches en une seule passe pour vérifier les devinettes. Chaque devinette acceptée est gardée plus un jeton propre, si bien que chaque passe coûteuse produit en moyenne entre 2,4 et 3,2 jetons au lieu d'un. Sur la même machine, le débit est monté de 47-57 jetons par seconde sans l'astuce vers la bande 82-92 avec elle. La question de savoir si la qualité en souffre a une réponse nette dans le test de l'équipe : même avec des devinettes volontairement fausses imposées, le texte est sorti identique à l'exécution sans prédiction. Cette prédiction multi-jetons porte un petit astérisque, car sur les versions IQ le GPU et le CPU arrondissent le même calcul d'expert très légèrement différemment, si bien qu'une requête peut finir de deux façons ; la vérification de l'équipe contre llama.cpp s'accorde sur 97,5 à 99 pour cent des positions. L'arrivée du support MTP général sur la période de mai 2026 est documentée dans le compte-rendu de LLMRequirements.

Le chiffre de six fois mérite un regard honnête. À la mi-septembre, avant que Strata n'existe, son auteur a exécuté la version 3 bits via un outil basé sur llama.cpp sur le même PC que celui des chiffres vedettes, un RTX 5070 avec un CPU six coeurs et 64 Go de DDR5, et obtenu 15 jetons par seconde, avec une requête de 20000 jetons prenant 3 minutes 11 secondes avant le premier mot. Le 18 septembre, la même installation était réglée à 29 jetons par seconde. La valeur vedette de 93 du projet Strata a été mesurée sur la version 2 bits ; diviser 93 par l'exécution 3 bits la plus lente donne 6,2. Comparer 3 bits à 3 bits place le ratio à 2,1. Dans ce qui est probablement le test le plus équitable à ce jour, un résultat d'utilisateur sur RTX 3090 a mis llama.cpp actuel à 31 jetons contre 74 pour Strata, un écart de 2,4x, avec l'équivalent devine-et-vérifie coupé côté llama.cpp. Personne n'a menti ; la référence la plus lente a simplement été divisée par le résultat le plus rapide. Le nombre qui compte pour les vraies machines se situe entre 2x et 2,5x selon le matériel et la version, et passer de 29 à 62 jetons par seconde sur un PC grand public reste un bond significatif.

Ce que le présentateur aurait aimé qu'on lui dise d'entrée : le GPU est presque la mauvaise chose à regarder. Plus de mémoire garde plus d'experts sur la carte ; le RTX 5090 de 32 Go a gardé 17463 des 24576 experts et écrit 179 jetons par seconde sur la version 2 bits pendant que le 5070 de 12 Go restait à 79 sur la même version. Mais le côté CPU, qui fait la moitié du travail, est borné par la bande passante mémoire : le processeur tire environ 42 Go par seconde depuis la mémoire pour la version deux bits, à peu près tout ce que le côté DDR5 peut donner. Comme le côté DDR4 offre la moitié de cette bande, la moitié CPU de chaque tour de couche prend environ deux fois plus longtemps sur une machine DDR4 ; la carte graphique flambant neuve attend le CPU, qui attend sa mémoire. La machine de test faisait même tourner sa mémoire à 5200 mégatransferts avec le profil de vitesse coupé dans le BIOS ; activer XMP ou EXPO prend environ 30 secondes et achète ici de la vitesse mesurable. Le seuil qui compte le plus est 64 Go de RAM : la version 2 bits veut 34 Go pour les experts plus environ 10 pour le système et tout le reste.

La facture mémoire et la décision honnête

La qualité est l'endroit où la compression coûte vraiment, et le tableau de quantification dit le prix. L'équipe derrière les fichiers quantifiés les a étalonnés contre le modèle complet : la pleine précision score 87,4 au test de code en direct tandis que la version Q2 2 bits écrivant 93 jetons par seconde se situe à 81,1, environ six points derrière. Le IQ3 3 bits atterrit à 86,3, un point sous le modèle complet, si bien que le fichier 3 bits à 62 jetons par seconde est celui du code et le 2 bits celui de la discussion. Pour l'échelle, en pleine précision Flash-Next bat le Qwen 3.8 de 27 milliards de paramètres de moins d'un point sur un test de code, 62,5 contre 61,7, si bien que l'avance que toute l'installation existe pour atteindre est déjà sous le point pendant que la version la plus rapide en rend six sur un autre test. La grimpée de l'indice des prix se compare aux prix des consoles de jeu dans la couverture DDR5 actuelle de Tomshardware ; 64 Go de DDR5-6000 étaient affichés à 913 dollars sur la période d'automne contre un plus bas historique de 159 dollars. La version hébergée coûte 0,47 dollar par million de jetons de sortie, si bien que 913 dollars achètent environ 1,9 milliard de jetons ; les écrire à 93 jetons par seconde prend plus de 240 jours de marche non-stop, et la copie hébergée répond à beaucoup de requêtes à la fois. Ce tarif est confirmé comme prix courant dans les données de PricePerToken.

Un développement enterré change le tableau : le 1er octobre, llama.cpp a intégré la prédiction multi-jetons réglée pour ce modèle exact, portant le décodage de 28 à 44 jetons, environ 1,55x, sur une machine tenant tout le modèle en mémoire de carte. Le hic est que sur les machines où le modèle déborde en mémoire système, ce qui couvre la plupart des spectateurs, la même fonction a tourné plus lentement ; chaque devinette supplémentaire tire ses propres experts depuis la mémoire à un coût supérieur au gain. Le rapport Strata montre son propre gain à 1,6-1,8x parce que le cache d'experts absorbe ce coût. Le cache d'experts lui-même reste un brouillon ouvert dans llama.cpp depuis le 28 août, dont l'auteur a mesuré 18,4 montant à 24,2 jetons sur deux cartes. Comme Strata est en partie né du code de llama.cpp, l'image est moins une prise de contrôle qu'une course publique à deux fonctions pour la tête. Le verdict est clair : un bureau détenant déjà 64 Go de DDR5 et une carte Nvidia de 12 Go ou plus devrait l'installer et l'exécuter ; qui doit acheter la mémoire de zéro devrait essayer le tarif hébergé d'abord.

Visualization: nodesdaily AI

Moments clés

  1. Un mot en trois minutes : la lenteur en image
  2. Strata en scène : 93 jetons sur 12 Go
  3. Seuls 4 Go lus par jeton
  4. Couches partagées : GPU et CPU ensemble
  5. Couche de brouillon : 3 jetons par passe
  6. Le calcul honnête derrière le 6x
  7. Vraie limite : la barre des 64 Go
  8. 913 dollars de RAM ou l'API ?
  9. Verdict : qui installe ce soir, qui attend

Commentaire de l’IA

"Ce qui me passionne ici, ce n pas le chiffre de vitesse mais un modèle pensé pour le matériel que les gens possèdent déjà. Le présentateur montre la référence au lieu de la cacher, et une fois que lon sait d'où vient le 6x, lhistoire cesse d'être un battage pour devenir une course à suivre."

Évaluation de l’IA

Le contre-argument le plus fort vise le titre : à réglages égaux, le gain est de 2 à 2,5x, et la version la plus rapide est la plus faible en code. La vitesse de 93 jetons appartient à une quantification six points sous le modèle complet, tandis que le fichier 3 bits qui comble l'écart tourne à 62. Le record de vitesse et le record de qualité ne vivent pas dans le même fichier, et l'acheteur doit choisir celui qu'il paie. Le calcul du titre ne trompe personne à lecture attentive, mais il peut encore envoyer un lecteur pressé vers le panier avec des attentes de 6x.

Des manques demeurent dans le récit à l'écran : les chiffres viennent d'une seule machine sur quelques semaines, et les utilisateurs DDR4, les cartes portables et le côté AMD ne sont traités qu'en passant. La qualité à long terme, les taux d'erreur sous charges d'agents et la cohérence à 128K de contexte restent des questions ouvertes. Strata est aussi une version 0.1 âgée de huit jours, donc interfaces, profils et outils de débogage bougeront vite. La position du présentateur mérite une note : un passionné assumé de l'inference locale qui partage l'enthousiasme, mais publie la référence au lieu de la cacher.

La règle pratique pour le lecteur est simple : avec 64 Go de DDR5 et une carte de 12 Go ou plus déjà sur le bureau, l'installation est de la vitesse gratuite, avec la version 3 bits pour le code, la 2 bits pour la discussion, et le profil mémoire activé dans le BIOS. Si la mémoire doit être achetée neuve, quelques millions de jetons sur l'API hébergée devraient précéder un achat de 900 dollars. L'architecture pensée pour le déport ressemble au changement durable, tandis que l'écart entre moteurs se referme par des requêtes publiques ; c'est la course elle-même, pas le chiffre, qu'il faut regarder.

Sources

8 liens ; aucun autre article publié ne les cite. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

ia locale · strata · qwen · mémoire · quantification · llama.cpp · matériel

Suivre le sujet

Avant cet article

Un court ordre de lecture des articles antérieurs reliés à cet événement par un éditeur.

Preuves et sources

Consultez les passages autorisés, leurs versions et leur origine.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…

125 milliards de paramètres à la maison | Nodesdaily