Retour au fil

Xiaomi MiMo v2.6 : Le run RL à 3 millions de dollars derrière le meilleur modèle ouvert

La famille MiMo v2.6 de Xiaomi — Pro et Flash — vise la première place open-source avec 46 points à l’Artificial Analysis Intelligence Index après 6 jours de RL en direct ; poids et code sur Hugging Face, tandis que Flash aligne 310 milliards de paramètres pour 15 milliards actifs.

Importé dans Nodesdaily : (UTC+03:00)
Voir sur YouTube — VSh8M3CUP88
Options de lecture

La lecture vocale n’est pas disponible dans ce navigateur.

Loupe à concepts

Choisissez un terme technique de cette vue pour lire sa définition générale, un exemple pédagogique et son usage dans l’article.

Aucun terme de notre glossaire n’a été trouvé dans cette vue. Le glossaire ne couvre pas encore tous les termes.

Les modèles ouverts qui rattrapent la frontière ne tiennent plus du slogan : Xiaomi débarque avec MiMo v2.6 — Pro et Flash — et, fait rare, diffuse six jours de RL en direct avec une facture d’environ 3 à 3,5 millions de dollars affichée. Le narrateur, qui couvrait peu Xiaomi auparavant, y voit une performance proche de GPT-5.6 sur plusieurs bancs d’agents, avec poids et code d’entraînement publiés et une génération 3D compétitive — signe d’un écosystème ouvert chinois qui a franchi un cap quand l’entraînement devient lui-même le spectacle.

Pourquoi un RL en direct compte

Pendant le RL, l’équipe a inversé l’usage : six jours de logs en direct au lieu d’un graphique a posteriori, une transparence présentée comme l’aboutissement de six mois de recherche. Décrite comme l’une des plus grosses allocations de calcul pour un modèle ouvert domestique, cette démarche fait du coût une méthode — comme un marathon dont les temps de passage s’affichent en public, transformant le budget en carnet de laboratoire plutôt qu’en argument marketing.

La famille compte deux modèles multimodaux natifs. La vidéo place Pro autour d’un billion de paramètres totaux pour environ deux milliards actifs par token, et Flash à environ 310 milliards pour 15 milliards actifs — cohérent avec l’architecture MoE documentée (mixture-of-experts — seuls les experts pertinents s’activent, comme un orchestre partiel) qui avait déjà porté V2.5 à un billion / 42 milliards actifs et un contexte d’un million de tokens. Poids sur Hugging Face, trois variantes sur OpenRouter et un codeur distillé de 9 milliards (Quinn 9B) complètent l’ensemble.

Architecture et matériel encore exigeants

La parcimonie explique l’échelle : MoE garde le calcul par token modeste malgré une capacité totale massive, et l’attention hybride — locale à fenêtre glissante plus attention globale éparse, prolongée par des têtes de prédiction multi-token — tient le contexte long sans faire exploser la mémoire KV (environ -40% vs attention complète). Le cache grossit toutefois avec le contexte, car poids et traces partagent la VRAM. Un tableau construit avec Claude suggère Flash en deux DGX en quantification complète, Pro exigeant environ huit H100 en pleine précision — la quantification compacte mais dégrade légèrement la fidélité.

Côté performances, le narrateur évite le score unique : à l’Artificial Analysis Intelligence Index, MiMo-V2.6-Pro atteint 46 points, devant Kimi K3 et Qwen3 Max comme meilleur modèle ouvert du lot, tout en restant derrière les meilleurs systèmes fermés. Le banc moins saturé Terminal-Bench 4.0 est mis en avant, où Pro et Flash frôlent le niveau GPT-5.6 Sol, confirmé par les tests maison. Sur la frontière coût, Pro apparaît Pareto-efficace : environ $0,43 en entrée et $0,87 en sortie par million de tokens, plusieurs fois moins cher que certains pairs.

L’accès reste fidèle à la promesse ouverte : poids sur Hugging Face, API sur OpenRouter et Xiaomi Open Platform avec identifiants en minuscules `mimo-v2.6-pro` / `flash`, tarification reconduite de V2.5 et mode UltraSpeed jusqu’à 20× plus rapide. Contexte généreux d’un million de tokens en entrée, 128k en sortie, et prix en cache-hit divisé par mille quand le préfixe est déjà en cache — avec Team Token Plan et Batch API désormais en V2.6.

Vérification en harnais, pas en one-shot

Le test préféré tourne dans le harnais DeepSeek — banc où l’agent navigue et agit avec outils inédits. Chargé de se documenter puis de bâtir une page de lancement vérifiée, le modèle brûle environ 45 millions de tokens, mais 98% proviennent du cache — comme réutiliser des photocopies. En mode médium multimodal (texte+image), il enchaîne recherches, captures et re-vérifications ; la page de première passe impressionne par sa fidélité aux thèmes et animations du blog pour Pro et Flash, présentée comme preuve que les boucles vérifiées reflètent le vrai génie logiciel, pas les one-shots.

Un interlude sponsorisé oppose deux recherches : le web général, résumé optimisé pour la pertinence et souvent adossé à des blogs SEO, contre le Developer Index de Firecrawl, qui indexe issues GitHub en temps réel, PR fusionnées et journaux de modifications pour livrer la source primaire. Sur une migration XM 7→8, les deux trouvent la correction syntaxique, mais l’index développeur expose les PR fusionnées et piège une erreur de wildcard où les blogs épinglent la mauvaise version — avec 500 crédits gratuits via MCP pour démarrer.

Les démos sondent la robustesse : un appel API en direct suit l’ISS avec précision sur une carte jour/nuit, un damier soulignant l’orbite, l’agent commençant même à télécharger des images ISS pour la modéliser en Blender avant d’être stoppé. Des assets Blender sont créés et animés par code, le 3D procédural par 3D Gaussian Splatting jugé correct mais non leader — DeepSeek 4.1 Flash restant devant — et le raisonnement spatial tout juste correct. Jeux et visuels sont désormais le minimum attendu ; le test porte sur la boucle vérifiée.

Le final élargit vers la science : des expériences rapportent des mathématiques formelles résolues avec Lean, plus des signaux précoces en science des matériaux et biochimie, sans RL spécifique au domaine. Le narrateur souligne sa non-expertise mais pose le cadre : le code est devenu un socle commun, la prochaine frontière est le monde physique et la recherche, et les premiers indices d’une utilité des poids ouverts dans ces domaines sont la vraie promesse, à condition que l’ouverture reste reproductible.

Visualization: nodesdaily AI

Commentaire de l’IA

"À mon sens, le vrai signal de MiMo v2.6 est la méthode : diffuser six jours d’entraînement en direct transforme l’opacité en transparence, et présenter 3,5 millions de dollars comme preuve rend crédible la promesse d’une performance frontière à prix contenu."

Évaluation de l’IA

En version la plus forte, MiMo v2.6 défend que poids ouverts + code d’entraînement + carnet RL en direct rapprochent la reproductibilité de la frontière sans facture frontière ; 46 points à l’index et une bonne tenue à Terminal-Bench 4.0 ancrent l’argument dans la mesure. Couplée à des boucles vérifiées en harnais, l’idée est celle d’un sous-agent fiable pour tâches cadrées, même si l’orchestration générale reste à consolider.

Les limites sont dans les notes : Pro réclame environ huit H100 en pleine précision et un cache KV qui gonfle avec le contexte — ouvert ne veut pas dire exécutable localement, mais ouvert à l’échelle entreprise. La comparaison Firecrawl tient sur une seule fenêtre XM 7→8 sous parrainage, sans ablation indépendante, et la vidéo note elle-même un raisonnement 3D/spatial tout juste correct, derrière DeepSeek 4.1 Flash.

Côté traçabilité, prix et scores sont vérifiables (page tarifaire Xiaomi, llm-stats, Artificial Analysis), mais le récit RL en direct repose sur les logs d’un seul acteur sans reproduction indépendante ; le test promis du codeur distillé 9B rappelle aussi que la preuve arrive par épisodes. Les reruns indépendants seront le vrai test.

En pratique, Flash séduit pour appels d’agents à haute fréquence, pipelines documents à long contexte et batch où le coût par intelligence prime ; pour le raisonnement lourd et la recherche frontière, Pro peut encore être distancé. Jugez sur votre propre taux de cache — pas les 98% vitrine — et sur la facture matériel incluant le cache, puis A/B face à une référence fermée avant de basculer.

Sources

7 liens ; 2 d’entre eux sont aussi cités par 1 autre article. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

xiaomi · mimo v2.6 · modele ouvert · apprentissage par renforcement · ia · agent · 3d

Suivre le sujet

Avant cet article

Un court ordre de lecture des articles antérieurs reliés à cet événement par un éditeur.

Preuves et sources

Consultez les passages autorisés, leurs versions et leur origine.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…

Xiaomi MiMo v2.6 : Le run RL à 3 millions de dollars…