L'actualité de l'IA de cette semaine est allée bien au-delà de l'annonce habituelle d'un modèle. En sept jours, trois modèles de monde, quatre modèles de langage à poids ouverts, deux modèles vedettes de robotique, plusieurs petits modèles embarqués et une initiative d'infrastructure IA dans l'espace sont arrivés ensemble. Le tableau qui s'en dégage est le suivant : les charges de travail résiduelles se concentrent sur les modèles à poids ouverts, la synthèse vocale en temps réel et la simulation du monde physique. Du côté fermé, la tendance n'est pas une montée unique mais un portefeuille qui se découpe en paliers de coût distincts au sein d'une même famille.
Trois modèles de monde, tous à la recherche d'une mémoire 3D
Le trio le plus visible de la semaine réunit des modèles qui cherchent à ancrer la génération vidéo sur une mémoire tridimensionnelle. WorldCrafter construit un monde explorable à partir d'un simple texte ou d'une image de référence et, ce faisant, reconstruit un nuage de points 3D : les objets ne disparaissent pas lorsqu'on détourne le regard. L'entrée arXiv de l'étude, intitulée WorldCrafter: Consistent Video World Model with Implicit 3D-aware Memory, résume cette approche. La page du projet le dit de façon simple : explorer un monde généré ne devrait pas signifier le perdre dès qu'on détourne le regard. Le second outil, MirrorScene, résout un problème complètement différent : il n'y a pas de vidéo ici, seulement une photographie. Il segmente les objets, estime la profondeur de la scène, génère une géométrie 3D pour chacun d'eux, puis les replace pour que la reconstruction corresponde à l'image d'origine. Chaque objet d'une photo devient ainsi sélectionnable séparément et peut être importé dans Blender ou relié à un simulateur physique pour l'entraînement de robots. Contrairement à de nombreuses méthodes de reconstruction à partir d'une image, qui renvoient un maillage fusionné, cette approche conserve les objets séparés, ce qui rend la chaîne de travail utilisable dès aujourd'hui.
Le troisième, GAE, tire son nom de Geometry-Native Autoencoder, et le titre du travail énonce la thèse sans détour : l'espace latent appris est lui-même de nature géométrique. Le travail décrit un modèle qui ne se contente pas de générer de la vidéo mais produit simultanément une carte de profondeur, une trajectoire de caméra et une reconstruction 3D de la scène. Le fait que le poids total reste sous 12 Go et que le code d'entraînement et d'évaluation soit publié en même temps montre que le domaine ne se contente plus de produire de belles séquences : il vise des expériences reproductibles.
La bataille des poids ouverts est avant tout une bataille de coût unitaire
Ce qui a bousculé le classement des poids ouverts, c'est moins l'indice d'intelligence que le coût par tâche . Le modèle MiMo-V2.6-Pro de Xiaomi a pris la tête de la liste des modèles ouverts d'Artificial Analysis (artificialanalysis.ai) (artificialanalysis.ai), et la page de comparaison le place côte à côte avec GLM-5.3 en montrant un écart d'environ un point. VentureBeat a rapporté que le modèle prenait la première place du monde ouvert après DeepSeek. Le modèle approche le trillion de paramètres, mais seule une petite fraction est activée à chaque exécution. C'est cette conception éparse qui évite de rendre le service impossible. La version Flash de la même famille est plus petite et moins chère. Les fiches de modèle et les relevés de tarifs indépendants situent le palier Pro à quelques dizaines de centimes par tâche et Flash autour de douze centimes. Le point intéressant n'est pas l'endroit où le coût a été rogné mais l'offrande devenue bon marché : automatiser un appel utilitaire de deux secondes ne demande plus un modèle de pointe généraliste. La fiche modèle de Hugging Face précise également la répartition entre paramètres actifs et totaux. La fiche du dépôt GitHub confirme cette architecture.
Un second laboratoire chinois, StepFun, a lui aussi sorti son modèle phare. Step 5 Preview est un modèle à mélange d'experts de 600 milliards de paramètres au total, dont 27 milliards actifs, une répartition que la fiche Hugging Face (huggingface.co) indique explicitement. Il prend en charge un contexte d'un million de jetons et priorise l'ingénierie logicielle et la recherche financière. La page de comparaison d'Artificial Analysis montre Step 5 avec environ un point de retard sur GLM-5.3 à l'indice, pour un coût environ trois fois inférieur.
La troisième sortie à poids ouverts est celle qui a le moins attiré l'attention. Le modèle dots3-note preview utilise une architecture éparse de 280 milliards de paramètres au total et 16 milliards actifs, avec une fenêtre de contexte de 512 mille jetons. Sa fiche sur Hugging Face (huggingface.co) montre le mieux pourquoi un modèle de cette taille se rapproche de rivaux bien plus gros : le test ARC-AGI , qui place un modèle dans un environnement de jeu qu'il n'a jamais vu et lui demande d'en déduire les règles tout seul. Comme les poids d'un transformateur sont figés, ce type de test est extrêmement dur pour la plupart des modèles ; la version FP8, à environ la moitié de la taille complète, compte pour le déploiement pratique. Les petits modèles à usage unique forment un courant secondaire intéressant. Limite 1B de Paradigma est un modèle d'un milliard de paramètres conçu uniquement pour les problèmes mathématiques difficiles, avec un score d'environ 94 pour cent au test de compétition mathématique de sa fiche, et un paquet complet sous deux gigaoctets. La version orientée sécurité de la semaine, Aikido Altar, est construite sur GLM-5.3 et compressée sous 400 Go en INT4 en retirant une partie de ses experts. Le résultat de test de sécurité indiqué sur la fiche AikidoSec montre que la version réduite conserve l'essentiel des capacités du modèle complet.
Parole, robotique et le matériel de l'orbite
Les nouveaux modèles de synthèse vocale de Google portent l'histoire audio de la semaine. Gemini 3.8 Flash TTS et sa version moins chère Flash-Lite permettent de concevoir une voix entièrement nouvelle à partir d'une consigne écrite, et la documentation met l'accent sur la fidélité en qualité studio, le jeu d'acteur expressif et les accents régionaux authentiques. Le billet de blog de Google confirme que les deux modèles ont été annoncés ensemble et sont disponibles via AI Studio et l'API Gemini.
La robotique a apporté deux approches distinctes. Black Forest Labs (bfl.ai), connue pour ses modèles d'image et de vidéo, a cette fois livré un modèle d'action pour robots : FLUX 3 Action reçoit une image caméra et une consigne textuelle et renvoie les deux secondes d'actions suivantes sous la forme d'un modèle d'action-monde à poids ouverts de sept milliards de paramètres. Le billet Hugging Face (huggingface.co) et The Decoder (the-decoder.com) indiquent qu'il arrive en tête du classement RoboLab après affinage sur le jeu de données DROID, et la fiche de modèle situe les poids autour de quatorze gigaoctets. Cette taille en fait un candidat pratique au contrôle de robot en temps réel. L'idée de Système Un a elle aussi trouvé une version ouverte cette semaine. En expliquant une classe de modèles qui décident vite et immédiatement au lieu de raisonner longuement, l'intervenant évoque CLM, publié conjointement par Stanford et Nvidia. CLM-8B renvoie un score de probabilité pour chaque option au lieu de générer une suite de jetons, et les tests le montrent jusqu'à neuf fois plus rapide que le modèle JEVA précédent tout en atteignant un taux de réussite comparable dans la plupart des situations. La raison est simple : beaucoup d'états de jeu ou de véhicule se résument à une observation instantanée plus un choix. Black Forest Labs souligne ce même virage dans son propre communiqué.
La robotique humanoïde a été une semaine de spectacle. UBTECH a annoncé que les premières unités de sa série U1, conçue avec des visages et des cheveux réalistes, commencent à être livrées, avec plus de treize mille précommandes et des prix à partir d'environ seize mille cinq cents dollars. Unitree a présenté une main de préhension de la taille d'une main humaine avec 22 degrés de liberté, montrée en train de plier les doigts, de jouer du piano et de couper du papier. Skild AI a démontré autre chose avec son modèle S1 : un joueur de football qui apprend en jouant contre lui-même dans NVIDIA Isaac Sim, accumulant l'équivalent de plus de 140 ans de jeu simulé. Le temps de simulation rapporté par GamesBeat donne une mesure concrète de cette échelle.
Le projet Sun Catcher de Google est l'entrée la plus ambitieuse et la moins mûre. Reuters a rapporté que l'entreprise prévoit de lancer un satellite prototype emportant des processeurs IA de génération Trillium, tandis qu'Ars Technica (arstechnica.com) souligne que le satellite sera limité à quatre puces fonctionnant par blocs de quinze minutes. Le billet de recherche de Google décrit l'objectif comme doter des constellations de satellites solaires de processeurs et de liaisons optiques en espace libre. En orbite basse le soleil est continu, ce qui produit nettement plus d'énergie solaire qu'au sol, et quatre obstacles doivent être résolus : vibrations de lancement, rayonnement, refroidissement et liaison laser. La fenêtre de test rapportée par Ars Technica montre à quel point le programme en est encore à ses débuts.
Les modèles fermés se répartissent en paliers de coût
Du côté fermé, OpenAI a présenté les paliers moyen et bon marché de la famille GPT-6. L'annonce décrit trois classes ordonnées de la plus à la moins performante, le palier intermédiaire Sol étant nettement moins cher que la classe la plus coûteuse. La version Luna est positionnée à environ sept centimes par tâche, pour des tâches rapides et simples. Cette semaine, l'écart de prix des modèles fermés s'est creusé de deux ordres de grandeur, et la comparaison avec la version Claude la moins chère montre un facteur de plusieurs centaines.
Claude Opus 5.5 d'Anthropic a été la principale sortie fermée de la semaine. L'annonce d'Anthropic définit le modèle comme le premier membre de la famille Claude 5.5, et la documentation de la plateforme indique une fenêtre de contexte d'un million de jetons avec un tarif de quatre dollars par million de jetons en entrée et vingt dollars en sortie. Les essais de l'intervenant le trouvent extrêmement fort en conception 3D, en programmation et en travail sur des interfaces web, tout en notant que son intelligence est proche de GPT-6 Astra et que son coût par tâche reste nettement plus élevé. L'annonce la plus contestée a été la découverte de Claude dans des données de génome. Anthropic indique qu'environ mille agents ont recherché des séquences répétées pendant 21 heures et 210 millions de jetons, et présente ce qu'ils ont trouvé comme un mécanisme ressemblant à CRISPR. Le reportage de The Verge (theverge.com) s'arrête exactement là : la découverte n'est pas encore vérifiée et des chercheurs du domaine jugent qu'elle n'est pas une priorité. La formulation d'Anthropic, elle, souligne que les agents ont fouillé indépendamment un vaste ensemble de séquences et réduit les résultats à une candidate digne d'un test, ce qui est le véritable résultat. The Verge place cet avertissement au cœur de son reportage.
Évaluation et conclusion pratique
Le vrai titre de la semaine n'est pas le nombre de produits sortis mais le glissement du coût unitaire. La comparaison des modèles ouverts d'Artificial Analysis montre qu'un prix de douze centimes par tâche est aujourd'hui réellement atteignable, alors que le même classement côté fermé reste dans la fourchette des dizaines de dollars. Cela transforme la question du meilleur modèle en question du modèle adapté à chaque tâche, et change la logique de décision des développeurs.
Une deuxième limite ne réside pas dans les modèles mais dans l'infrastructure de mesure. Quand les comparaisons d'un éditeur et le classement d'un organisme d'évaluation indépendant divergent, un écart d'un point dans l'indice ne veut plus rien dire. Pour Grok 4.7, les comparaisons de l'éditeur sont flatteuses alors que l'évaluation indépendante montre un modèle en retrait sur l'indice et coûteux par tâche. Une troisième limite tient à ce que les poids ouverts signifient en pratique. L'échelle réside désormais dans la taille des fichiers : 573 Go pour la famille MiMo, 577 Go pour dots3-note. Ce tableau rappelle qu'un modèle à poids ouverts n'est ouvert qu'à ceux qui disposent du matériel suffisant, ce qui est un groupe bien plus restreint que le slogan ne le suggère. La comparaison des modèles ouverts d'Artificial Analysis cantonne cet écart à environ un point.
L'enseignement pratique est simple : cessez de demander quel modèle est le plus intelligent et commencez par demander quel modèle doit faire quel travail. Pour les tâches longues et sensibles au coût, les versions ouvertes bon marché sont désormais suffisantes. En synthèse vocale, en monde 3D et en contrôle robotique, la chaîne d'outils s'est assemblée si vite que le paysage de la fin d'année sera presque certainement très différent de celui du début d'année.
Moments clés
- Vue d'ensemble de la semaine
- WorldCrafter et la mémoire 3D
- Le modèle de design Ming-Image
- MirrorScene et le flux Blender
- Le contrôle robot FLUX 3 Action
- Gemini 3.8 Flash TTS
- MiMo-V2.6-Pro prend la tête ouverte
- Step 5 et le travail agentique
- OpenMuse et les agents personnels
- CLM et l'idée de Système Un
- Évaluation de Grok 4.7
- GPT-6 Sol et Luna
- Claude Opus 5.5
- La découverte génomique de Claude
- Robots : UBTECH, Unitree, Skild AI
- Sun Catcher et l'infrastructure orbitale
Commentaire de l’IA
"Le nombre de sorties est impressionnant, mais l'histoire réelle se trouve dans les tableaux comparatifs, pas dans les communiqués. Quelques dollars d'écart au sein d'une même famille peuvent faire basculer une charge de travail d'un palier à l'autre. Le saut des poids ouverts est réel ; ce qui reste incertain, c'est la durabilité de la courbe prix-performance des modèles fermés."
Évaluation de l’IA
L'objection la plus forte est qu'une bonne partie de cette semaine a été présentée comme bien plus importante qu'elle ne l'est en usage réel. Les déplacements dans les classements des modèles à poids ouverts en particulier doivent être lus à une période où des infrastructures d'évaluation différentes produisent des classements différents. Dès qu'un écart s'ouvre entre les bancs d'essai d'un éditeur et le classement d'un organisme indépendant, un point de différence ne signifie plus rien.
Ce qui manque, c'est des données de long terme sur la robustesse de ces systèmes dans le monde réel. Le modèle d'action robotique, le moteur de jeu et les tests d'interface web se passent dans des cadres courts et contrôlés ; on ne sait pas encore comment ces mêmes systèmes se comportent dans des environnements ouverts, complexes et partiellement imprévisibles. Le schéma commun de ces démonstrations est un résultat brillant sous conditions contrôlées et une fragilité inattendue en dehors.
Les intérêts de l'intervenant méritent aussi attention. Vanter chaque produit à égalité dans un tour hebdomadaire laisse le spectateur devant un tableau gonflé. Dans l'état actuel des infrastructures de mesure, il est presque impossible à une seule chaîne d'évaluer correctement quinze produits distincts en un seul tour. Ces tours hebdomadaires ont de la valeur parce qu'ils rendent visible l'écart entre les affirmations d'un éditeur et le classement d'un organisme indépendant, mais ils ne suffisent pas à eux seuls à fonder une décision.
L'enseignement pratique pour le lecteur est le suivant : demander quel modèle doit faire quel travail plutôt que quel modèle est le plus intelligent. Pour les tâches longues et sensibles au coût, les versions ouvertes bon marché sont désormais suffisamment bonnes. En synthèse vocale, en monde 3D et en contrôle robotique, la chaîne d'outils s'est assemblée si vite que le paysage de fin d'année différera presque certainement de celui du début d'année.
Sources
22 liens ; 9 d’entre eux sont aussi cités par 17 autres articles. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
- @youtube.com YouTube — AI weekly news roundup
- @siliconangle.com SiliconANGLE — Xiaomi MiMo-V2.6 series open-sourced
- @venturebeat.com VentureBeat — MiMo-V2.6-Pro open weights lead
Également cité par : Xiaomi MiMo-V2.6 Pro Tops Open-Weights: 1M Context and 20x UltraSpeed at Record Price-Performance
- @artificialanalysis.ai Artificial Analysis — MiMo-V2.6-Pro vs GLM-5.3
- @stepfun.com StepFun — Step 5 Preview
Également cité par : Opus 5.5 Leak and China's 600-Billion-Parameter Wave: Qwen, Kimi and MiniMax Crowd the Same Week
- @huggingface.co Hugging Face — Step-5-Preview model card
- @github.com dots3-note preview repository
- @arxiv.org arXiv — WorldCrafter
- @arxiv.org arXiv — GAE geometry-native latent space
- @the-decoder.com The Decoder — Black Forest Labs FLUX 3 Action
- @huggingface.co Hugging Face blog — FLUX 3 Action
- @blog.google Google blog — Gemini 3.8 TTS
Également cité par : Google's Five AI Moves: Gemini Inside the Tools You Already Use
- @openai.com OpenAI — GPT-6 Sol and Luna
Également cité par : Space Bunny Alpha: Inside OpenRouter's Free Anonymous AI Experiment · The AI Price War: Opus 5.5, GPT-6 Sol and the Quiet Bottleneck of the Agent Era · Four Launches in One Day: the Opus 5.5 Comeback and the GPT-6 Sol and Luna Price Break · The Market Is Underestimating This Massive AI Demand Shift
- @anthropic.com Anthropic — Claude Opus 5.5
Également cité par : The superintelligence race: Musk and Huang on energy, orbital compute and safe agents · Claude Opus 5.5: From Idea to Finished Work in a Single Session · Before Buying the $12,000 Mac Studio, Rent a Test for $2 an Hour · OpenAI's "o" Assistant, Claude Sonnet 5.5 and MiniMax M3.1: Three Model Bets Before DevDay · The AI Price War: Opus 5.5, GPT-6 Sol and the Quiet Bottleneck of the Agent Era · Four Launches in One Day: the Opus 5.5 Comeback and the GPT-6 Sol and Luna Price Break · Decide First, Generate Later: The Jev Plus Opus 5.5 Playbook · The Market Is Underestimating This Massive AI Demand Shift · I Tested Opus 5.5 on 24 Coding Tasks: Fable-Level Quality in Half the Time and Cost · Claude Opus 5.5 in the Wild: One-Hour Award Site, 3D Space Voyage and a Single Dashboard
- @theverge.com The Verge — Anthropic biolab Crispr claim
- @aikido.dev Aikido — Altar open-weight security model
- @venturebeat.com VentureBeat — CLM-8B System One
Également cité par : Decisions as Retrieval: CLM-8B, the 13x Faster Architecture
- @reuters.com Reuters — Project Suncatcher satellite
Également cité par : Tunç Şatıroğlu: Market Bottomed — New High First, Then October Pullback Scenario
- @arstechnica.com Ars Technica — Suncatcher orbital test
Également cité par : Tunç Şatıroğlu: Market Bottomed — New High First, Then October Pullback Scenario
- @gamesbeat.com GamesBeat — Skild AI S1 self-play football
- @artificialanalysis.ai Artificial Analysis — Benchmarking Grok 4.7
Également cité par : Grok 4.7 Is Here: Did Elon Deliver? Half the Price, One Step Off the Frontier
- @huggingface.co Hugging Face — Limite 1B Violetto
intelligence artificielle · modèles à poids ouverts · robotique · modèles de monde · synthèse vocale · infrastructure spatiale