Retour au fil

Bonsai 27B vaut-il vraiment 98 % de Qwen3 27B ? Un test ternaire en conditions réelles sur une seule RTX 3090

Digital Spaceport a fait tourner le Bonsai 27B ternaire de PrismML sur une seule RTX 3090 : un empreinte de 16,7 Go et 68 tok/s semblent solides, mais la qualité de génération arcade ne confirme pas la revendication de 98 % en pratique.

Importé dans Nodesdaily : (UTC+03:00)
Voir sur YouTube — 975ILFNTKfk
Options de lecture

La lecture vocale n’est pas disponible dans ce navigateur.

Loupe à concepts

Choisissez un terme technique de cette vue pour lire sa définition générale, un exemple pédagogique et son usage dans l’article.

Aucun terme de notre glossaire n’a été trouvé dans cette vue. Le glossaire ne couvre pas encore tous les termes.

Une seule RTX 3090 peut-elle faire tourner un modèle de 27 milliards de paramètres suffisamment bien pour remplacer son jumeau pleine précision ? C'est la question que Digital Spaceport passe sur le banc d'essai, en utilisant le Bonsai 27B ternaire de PrismML. Les spectateurs demandent sans cesse quel est le meilleur modèle pour une carte ou deux petites cartes, et l'épisode le teste directement. La revendication phare encadre le test : une version neuf fois plus petite préserve-t-elle presque toute la capacité de Qwen3 27B ?

Ce que signifie ternaire — trois valeurs, neuf fois plus petit

Ternaire paraît simple : chaque poids vit dans l'un des trois états, moins un, zéro, plus un, au lieu de deux. Ce troisième état réduit l'erreur de quantification par groupe d'échelle. Dans les chiffres que publie PrismML, un modèle 27B qui occupe environ 54 Go en 16 bits tombe à environ 5,9 Go en ternaire et 3,9 Go en binaire. Soit une réduction d'environ neuf fois, ce qui place le modèle complet confortablement dans le budget d'une carte de 24 Go.

Cette réduction n'est pas un simple habillage. Bonsai s'appuie sur Qwen3 27B, déplace environ les trois quarts de ses couches d'attention vers une forme linéaire et garde une fenêtre de 262K tokens exploitable sur l'appareil. La pile de langage est compressée de bout en bout — embeddings, projections d'attention, MLP et tête LM partagent la même représentation basse précision sans contournement haute précision. La tour de vision est livrée séparément en HQQ 4 bits afin que captures d'écran et documents voyagent avec le texte. Un décodeur spéculatif DSpark s'ajoute par-dessus comme un gain sans perte de type draft-and-verify.

La configuration — Proxmox LXC et une seule 3090

L'installation est un rig d'auto-hébergement familier : un conteneur LXC Proxmox 9 numéroté 118 sur l'hôte Prox 2. Le téléchargement depuis Hugging Face est rapide car l'artefact est assez petit pour sauter la clé. Le lancement passe par le llama server starter de PrismML depuis le dépôt de démo. Un détail important : le llama.cpp principal ne transporte pas encore ces noyaux basse précision en amont, il faut donc tirer le fork de PrismML pour des sorties correctes. Le câblage de l'environnement lie BONSAI_HOST à 0.0.0.0, laisse la taille de contact sur auto et garde le spéculatif et la compression du KV-cache désactivés pour cette exécution.

Une fois chargée, la carte affiche environ 16,772 Go occupés, laissant de la marge dans les 24 Go. Le serveur devient joignable sur 192.168.1.61:8080. Le débit de chat initial se situe autour de 68 à 69 tokens par seconde et s'y maintient un moment. Pour référence, la précédente exécution de Qwen3 27B pleine précision sur quatre RTX 3090 avec vLLM tournait autour de 40 tokens par seconde. Le contexte est réglé à 131K ; l'augmenter a du sens pour des boucles multi-étapes façon Hermes Agent. Le chemin de vision reste activé.

Test arcade — mêmes entrées, sorties différentes

Le test central est un face-à-face équitable : le même paquet arcade précédemment généré avec le Qwen3 27B pleine précision est régénéré avec Bonsai. L'agent façon Hermes s'engage, des traces de réflexion apparaissent, le traitement de prompt tourne autour de 1 250 tokens par seconde. Une génération compte environ 25 000 tokens, le travail de prompt est négligeable et le décodage se stabilise près de 64,4 tokens par seconde. Les résultats sont prévus pour un jeu côte à côte sur arcade.digitalspaceport.com.

Chacun des trois mini-jeux raconte une facette différente. Le shooter ne se déplace que latéralement, le flux d'ennemis paraît excessif, le score reste minuscule à environ 16 000 en haut à gauche, et le boss tire dans le mauvais sens. Les notes se situent entre C moins et D plus. Space Racer paraît raide, les changements de voie sont brutaux, la minuscule police n'aide pas, et les contrôles frôlent l'injouable. Pixel Breaker s'en sort mieux : la vignette clôture et chat est correcte, la musique paraît ringarde mais le gameplay est plus fluide, pas plein écran mais les étoiles destructibles réagissent comme prévu.

Est-ce 98 % — la note de terrain

La note finale dans la vidéo est sans détour : deux échecs et un D plus, avec une qualité nettement en retrait par rapport à l'exécution pleine précision. L'hôte dit que cela ne fait pas sensation de 98 %, et les bizarreries dans les couches créatives — logique de niveaux, musique, petits écarts de score — le confirment. L'histoire colle aussi aux chiffres de labo : environ 80,49 contre 85,0 sur une moyenne de 15 benchmarks, soit environ 94,6 % conservés. La moyenne de labo et une génération créative unique ne sont pas la même chose ; la seconde est plus sévère.

Là où vitesse et usage d'outils brillent

Le point fort, c'est la vitesse et l'usage d'outils. Le chat paraît fluide, les appels d'outils hors code aboutissent bien, et aucun appel manqué n'a été observé dans cette exécution. Un décodage mono-flux près de 68 tokens par seconde sur une 3090 se traduit par jusqu'à 134 tokens par seconde en ternaire et 163 en 1 bit sur une 5090, et environ 58 et 87 sur un M5 Max selon les chiffres publiés. Le gain sans perte de 1,34x de DSpark fait partie du tableau. C'est assez pour qu'une seule carte paraisse viable pour un assistant mono-thread persistant.

La limite est tracée aux agents de code en continu. L'épisode précise que c'est bien pour le chat et les flux d'agents mono-thread, mais pas encore un bon moment pour le développement de code agentique. La raison est la baisse de qualité constatée dans la génération de code créative et structurelle ; même avec un long contexte et une attention linéaire, la cohérence entre niveaux glisse. Il y a de la marge d'amélioration quand les noyaux forkés arriveront en amont et que le budget de contexte grandira, et la configuration à deux 3060 12 Go aura son propre test de vitesse.

Le constat pratique se lie aux prix du matériel. Le tableau en direct de la chaîne montre des RTX 3090 d'occasion autour de 1 400 dollars et en hausse, tandis qu'une 3060 12 Go se situe autour de 300 dollars. La configuration double 3060 est testée séparément pour la vitesse. Une seule 3090 se trouve déjà au seuil pratique en mémoire et débit. Choisir cette configuration a du sens si votre projet est un assistant, de la lecture de documents et une automatisation légère sur une carte ; faire d'agents de code totalement autonomes ou de la génération de jeux gourmande en vision la charge principale, c'est prématuré.

Visualization: nodesdaily AI

Moments clés

  1. Ouverture — la question de la 3090 unique
  2. Logique ternaire — moins un, zéro, plus un
  3. Configuration du conteneur 118 et llama.cpp forké
  4. Lecture mémoire — 16,772 Go occupés
  5. Vitesse — 68 à 69 tok/s
  6. Génération arcade de 25K tokens
  7. Est-ce 98 % ? — deux notes faibles, une moyenne

Commentaire de l’IA

"« Ce qui me frappe, c'est la façon dont Bonsai fait passer la densité du papier à une seule carte ; cela dit, il faut peser la baisse de qualité en génération créative avant de lui faire confiance pour des agents de code en continu. »"

Évaluation de l’IA

En défense de PrismML, la revendication de labo est solide : environ 80,49 contre 85,0 sur une moyenne de 15 benchmarks pour le ternaire, soit environ 94,6 % conservés, et 76,11, environ 89,5 %, pour le 1 bit. Les maths vers 93,4 contre 95,3, le code vers 86,0 contre 88,7 et les connaissances STEM vers 77,0 contre 83,1 gardent l'écart étroit sur les compétences exactes dont les charges agentiques ont besoin. Le récit de l'attention hybride et de la compression de bout en bout tient : environ trois quarts de couches linéaires plus un KV-cache 4 bits gardent une fenêtre de 262K exploitable sur l'appareil. Dans ce cadre, affirmer une réduction de neuf fois sans perte dramatique est défendable.

Le test de terrain arcade montre que la moyenne de labo ne se transpose pas un à un à la génération créative. Sur les trois jeux, la logique de niveaux, les collisions et la mise à l'échelle des polices glissent ; le boss tire dans le mauvais sens, le placement du score reste minuscule et le jeu devient répétitif. Une génération de 25K tokens est un échantillon mince pour des affirmations générales, pourtant deux notes faibles et un D plus suggèrent que le cadre marketing honnête est 94 à 95 % plutôt que 98. L'exécution a aussi utilisé un build forké de llama.cpp et un contexte de 131K ; l'arrivée en amont et une fenêtre plus grande pourraient combler l'écart, mais la dépendance au fork est un coût aujourd'hui.

Sur la vérifiabilité, les chiffres clés concordent entre sources : 54 Go à 5,9 Go, une lecture d'occupation de 16,77 Go, environ 68 à 69 tokens par seconde sur une 3090, et des plafonds publiés vers 134 en ternaire et 163 en 1 bit sur une 5090, 58 et 87 sur un M5 Max. Ce sont des valeurs reproductibles sur des rigs indépendants, non gravées dans le marbre. Une seconde variable en mouvement est le prix du matériel : des 3090 d'occasion autour de 1 400 dollars ont grimpé ces derniers jours, ce qui change l'équation 27B mono-carte demain. Des lacunes de méthode subsistent aussi : pas de test multilingue, de documents longs ou de chaîne d'outils étendue dans cet épisode, donc l'arcade seul ne prouve pas la compétence agentique.

En pratique, le choix dépend du travail. Pour le chat quotidien, le Q&A de documents, l'automatisation légère consciente de la vision et les boucles d'agents mono-thread façon Hermes, Bonsai 27B est déjà utilisable : il tourne en local, les données restent sur l'appareil, le coût marginal est nul et la vitesse passe la barre. Si les agents de code en continu, la génération de niveaux à long horizon ou une sortie créative haute fidélité sont la charge principale, le Qwen3 27B pleine précision ou un modèle cloud de pointe reste le pari plus sûr. La voie double 3060 12 Go est un plan B économique ; n'attendez simplement pas un parcours sans accroc sans compter les pilotes et les noyaux forkés.

Sources

7 liens ; aucun autre article publié ne les cite. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

bonsai 27b · ternaire 1.58-bit · qwen3 27b · rtx 3090 · llama.cpp

Suivre le sujet

Avant cet article

Un court ordre de lecture des articles antérieurs reliés à cet événement par un éditeur.

Preuves et sources

Consultez les passages autorisés, leurs versions et leur origine.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…