Retour au fil

Des modèles géants sur un mini-PC à 3 000 $ : que fait vraiment 128 Go unifiés ?

The Stack dissèque le Bosgame M5 128 Go (AMD Ryzen AI Max+ 395, Strix Halo) : un vivier cinq fois plus grand qu’une carte 24 Go permet de loger d’énormes modèles, mais 256 Go/s dictent la vitesse par token. Les architectures MoE filent plus vite que les denses, les longs prompts butent sur le calcul, et le prix passé de 1 699 $ à 2 999 $ change la donne.

Importé dans Nodesdaily : (UTC+03:00)
Voir sur YouTube — CJz2edJ62HQ
Options de lecture

La lecture vocale n’est pas disponible dans ce navigateur.

Loupe à concepts

Choisissez un terme technique de cette vue pour lire sa définition générale, un exemple pédagogique et son usage dans l’article.

Aucun terme de notre glossaire n’a été trouvé dans cette vue. Le glossaire ne couvre pas encore tous les termes.

Le mini-PC M5 de Bosgame renverse la logique habituelle de la carte graphique : au lieu d’un VRAM séparé de 24 Go, CPU et GPU intégrée partagent une même réserve de 128 Go . Cette mémoire unifiée d’AMD — Ryzen AI Max+ 395 (Strix Halo) où processeur et partie graphique puisent dans la même mémoire physique — permet à un seul modèle de dépasser le plafond de 24 Go de plus de cinq fois . La question de The Stack est claire : mettre autant de mémoire sur un bureau pour 3 000 $ en fait-il la meilleure option pour l’IA locale, ou loger le plus gros modèle n’est pas synonyme de réponse la plus rapide ?

Que signifie vraiment « unifié » — et pourquoi c’est plus lent

Dans un PC normal, le CPU a sa RAM et la carte graphique garde son VRAM privée de l’autre côté du bus PCIe. Chargez un modèle dense de 70 milliards de paramètres sur 24 Go et il déborde vers la mémoire système, s’effondrant. Le M5 supprime ce mur. Imaginez le modèle comme un énorme livre à déployer à plat avant de lire un mot — le bureau partagé est immense, les modèles géants tiennent d’un seul tenant. Le non-dit est le débit : TechPowerUp mesure la réserve partagée à ~256 Go/s , plusieurs fois moins qu’une carte dédiée à ~1 008 Go/s sur RTX 4090. Chaque mot exige de balayer les nombres du modèle, une fois par token ; le débit dicte donc la vitesse d’affichage. Sous Linux, le matériel graphique ne reçoit pas automatiquement tout le vivier ; approcher les ~110 Go utilisables cités par les guides demande un réglage noyau pour relever l’allocation.

Quels modèles tiennent et restent rapides relève de l’architecture. Un modèle dense — chaque paramètre s’active à chaque mot — tient même à 70B mais doit traîner 70B nombres sur le bus à chaque token, rampant à 4-5 tokens/s . Un Mixture-of-Experts (MoE — activation sparse où seuls quelques experts s’allument par mot) fait l’inverse : un géant de 120B garde une vaste bibliothèque résidente mais ne route que 5-6B paramètres actifs par mot. Comme n’ouvrir que la bonne étagère à chaque question. Les mesures de la chaîne sur ce silicium le montrent : Qwen3 et GPT-OSS 120B oscillent de 15 à 56 tokens/s selon le backend, tandis qu’un MoE 30B dépasse 70 tokens/s . Quand le plus petit MoE est le plus rapide, l’architecture compte autant que la capacité.

Combien de mémoire faut-il ? La règle 0,6 Go et les chiffres divergents

Pour estimer, Model Fit publie ~0,6 Go par milliard de paramètres en 4-bit . Alors 80B ~50 Go , 120B ~65 Go , bien sous le plafond de 110 Go. Pourtant pas de vitesse unique : Mine Studio voit GPT-OSS 120B à ~30 tokens/s et 35B au-dessus de 50 , quand Model Fit affiche une estimation non testée à 11 tokens/s . L’écart vient des drapeaux de compilation et du runtime (llama.cpp, ROCm). La propre répétition de la chaîne le prouve : même modèle Qwen rampant à 1,79 tokens/s sans optimisation bondit à 15,56 tokens/s avec les bons drapeaux sur le même silicium. La règle demeure : moins de paramètres actifs par mot, moins de données à traverser, flux plus rapide.

Le titre d’AMD « 2,2× plus rapide qu’une RTX 4090 » n’a de sens que dans un couloir. Pour Llama 3.1 70B qui ne tient pas en 24 Go, la 4090 doit siroter le débordement via le bus PCIe comme un marathonien à la paille à cocktail ; le M5 garde l’ensemble dans sa mémoire unifiée plus lente et l’arithmétique tombe juste. Cette comparaison CES 2025 a été construite sur ce débordement. La communauté r/LocalLLaMA a aussitôt vu le piège : Strix Halo n’a pas détrôné le roi du bureau, AMD a choisi le banc le plus favorable. Quand le modèle tient en 24 Go, la carte dédiée est nettement plus rapide . Vous troquez la vitesse de génération contre la capacité à loger des géants dans un minuscule châssis.

Lire l’invite n’est pas écrire la réponse

Générer du texte, c’est deux métiers : prefill (ingérer toute l’invite d’un coup) et decode (émettre mot à mot) . Le decode est lié à la bande passante et le M5 s’en sort ; les gros MoE filent à vitesse conversationnelle. Le prefill est du calcul parallèle pur. Avant le premier token, le modèle doit digérer phrases, bouts de code et clarifications collés — en une fois. C’est là que le Radeon 8060S intégré, aussi ambitieux soit-il, s’essouffle face à une GPU de bureau. Les testeurs Strix Halo sur Reddit décrivent cette phase comme limitée par le calcul , goulet sensible sur longues invites. Un chat bref l’efface ; un assistant de code local non : à chaque tour il emballe docs, fichiers entiers, arborescence et erreurs de compilation, déversant bien plus que votre phrase. Renommer une variable sur tout un repo, c’est une longue ingestion avant même de répondre — facturée à chaque tour.

L’installation est un projet à part. Windows voit la boîte comme un bureau poli et ne réserve qu’une part prudente au graphique ; il faut relever l’allocation soi-même avant de charger du lourd, et le menu bouge selon la machine et le pilote. Puis le logiciel pèse plus que le silicium : llama.cpp sur le même Qwen passe de 1,79 à 15,56 tokens/s rien qu’avec drapeaux et backend. La pile ROCm est une cible mouvante : un développeur a passé 9 mois sur quatre versions ROCm sur une machine 96 Go à tenter de faire tourner le moteur VLM sans succès, avant de le voir fonctionner sur les versions récentes sans contournements — tandis que d’autres sur matériel identique doivent encore compiler depuis les sources. Avant d’acheter pour un outil précis, vérifiez son état *actuel* ROCm/llama.cpp plutôt qu’un test daté.

Le prix : 1 699 $ à 2 999 $, pic à 3 847 $ et mémoire soudée

Le prix seul est une leçon. Au lancement, 1 699 $ pour 128 Go ; aujourd’hui la vitrine Bosgame affiche 2 999 $ — bond de 1 300 $ . Guru3D avait rapporté le prix d’intro quand seul le 128 Go était proposé. La 96 Go est de quelques centaines moins chère, mais la disponibilité prime : toutes les anciennes annonces à bas prix sont épuisées, seul compte le prix de la config réellement achetable. Model Fit a vu une boîte comparable grimper près de 3 847 $ en juillet 2026 au pic de la pénurie mémoire ; la même gamme avait démarré près de 2 000 $ . Une machine qui est surtout de la mémoire bouge avec le prix de la mémoire. Et cette mémoire est de la LPDDR5X soudée — câblée à la carte car l’interface rapide l’exige. On n’ouvre pas le boîtier pour ajouter des barrettes. Payer 3 000 $ pour une boîte non extensible change le calcul ; d’où le conseil : achetez exactement la taille que votre plus gros modèle prévu exige, pas le palier le moins cher.

Écartons le bruit marketing et la conclusion s’affine. La promesse Bosgame « jeu égal à RTX 4070 » et le gros chiffre TOPS sur la fiche relèvent du fournisseur ; la première est une diapo vendeur, le second compte le NPU (processeur neuronal) alors que toutes les mesures ici venaient du côté graphique. Plus important, chaque concurrent autour de ce silicium AMD utilise même CPU et même architecture graphique ; voir Ryzen AI Max+ 395 sur l’annonce signifie moteur identique — le M5 est une façon d’acheter cette puce, pas la façon évidente. À son prix actuel, comparer qualité de fabrication, support et garantie vaut largement le détour. La leçon : capacité (que peut-on charger) et vitesse (à quelle vitesse ça file) sont deux questions séparées . Le M5 offre un luxe rare — d’énormes MoE frontières tenus localement et au calme — jumelé à l’expérience humble de le voir mastiquer de longues invites à son rythme. Une fiche généreuse sur l’un ne dit rien sur l’autre.

Visualization: nodesdaily AI

Comparaison débit

  • M5 unifiée (256)256 Go/s
  • RTX 4090 (1008)1 008 Go/s
Déficit de débit du vivier unifié — TechPowerUp et GDDR6X.
MétriqueM5 Strix HaloRTX 4090
Mémoire128 Go unifiée24 Go VRAM
Débit~256 Go/s~1 008 Go/s
Dense 70B4-5 tok/sdéborde -> lent
MoE 120B15-56 tok/sne tient pas
Prix liste2 999 $ (128Go)~1 599 $

Moments clés

  1. La question : que fait un mini-PC à 3 000 $ ?
  2. Supprimer le mur : mémoire unifiée 128 Go
  3. Analogie du bureau et 256 Go/s
  4. MoE vs dense : 5-6B actifs vs 70B à 4-5 tok/s
  5. MoE 120B 15-56 tok/s, MoE 30B 70+ tok/s
  6. Le 2,2× vs 4090 et la paille PCIe
  7. Prefill vs decode : limite calcul sur longues invites
  8. Assistant code ingère le dépôt à chaque tour
  9. 1,79 à 15,56 : les drapeaux font la vitesse
  10. 1 699 → 2 999 → 3 847 : prix et LPDDR5X soudée

Commentaire de l’IA

"Mon avis : ce n’est pas un démon de vitesse, c’est un démon de capacité. Garder un énorme MoE en local à vitesse conversationnelle est séduisant ; attendre qu’un assistant qui ingère des milliers de lignes à chaque tour reste vif, c’est confondre capacité et vitesse."

Évaluation de l’IA

À son meilleur, le cas se tient : si l’on veut un gros MoE tenu localement et au calme, une réserve unifiée de 128 Go qui loge 120B en ~65 Go et fait filer la conversation est une réponse pratique rare. Le pivot est l’architecture — 5-6B paramètres actifs par mot soulagent la bande passante et ouvrant la bande 15-56 tokens/s observée. Vu ainsi, le M5 est un arbitrage assumé : de la vitesse brute contre de la capacité, en échange de confidentialité et d’accès permanent.

Les limites sont nettes : réserve immense mais lente (256 Go/s), modèles denses effondrés à 4-5 tokens/s, et GPU intégrée limitée par le calcul sur longues invites, avec pause d’ingestion sensible avant chaque tour en contexte dépôt. L’installation est sensible — allocation Windows plus flags ROCm/llama.cpp expliquent le saut 1,79 à 15,56 tokens/s sur même silicium — et la saga VLM de 9 mois montre une pile logicielle plus volatile que le matériel. Il y a aussi un trou méthodologique : pas de vitesse unique faisant autorité, chaque source mesure avec des backends/flags différents, donc toute généralisation reste fragile.

Pour les intérêts et la vérifiabilité, lisez les gros titres avec prudence : « 2,2× vs 4090 » ne vaut que quand la charge déborde 24 Go ; quand elle tient, la carte dédiée l’emporte. Les promesses jeu/TOPS comptent le NPU, hors périmètre des mesures côté graphique ici. Le prix compte aussi : 1 699 à 2 999 $ aujourd’hui, 3 847 $ au pic mémoire de juillet 2026, et LPDDR5X soudée lie le coût au cycle mémoire sans évolution. Des mesures indépendantes existent par morceaux (Mine Studio, Model Fit, rediffusions internes) mais pas comme comparaison contrôlée unique, donc chaque vitesse se lit « quel backend, quels flags, quelle allocation ».

Pratiquement : si votre usage est le chat local avec un gros MoE sparse et une petite boîte silencieuse, le trio modèle sparse large + bon backend + ~110 Go d’allocation peut convenir. Pour du contexte long à ré-ingestion fréquente comme l’assistant de code, le plafond de calcul intégré mord — prévoyez la pause d’ingestion à chaque « corrige tout le repo ». À l’achat, dimensionnez la mémoire au plus gros modèle réellement prévu, pas au palier le moins cher ; puisque chaque concurrent autour de ce silicium AMD utilise le même moteur Ryzen AI Max+ 395, comparez sur fabrication, support et garantie en gardant capacité vs vitesse comme deux questions distinctes.

Sources

8 liens ; aucun autre article publié ne les cite. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

bosgame m5 · strix halo · mémoire unifiée · moe · ia locale

Suivre le sujet

Avant cet article

Un court ordre de lecture des articles antérieurs reliés à cet événement par un éditeur.

Preuves et sources

Consultez les passages autorisés, leurs versions et leur origine.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…