C'est le premier long point de l'animateur après un mois d'absence de son installation habituelle, et il condense huit fuites distinctes en un seul survol : Gemini 4 Pro, GPT-6 Soul, Grok 4.7, Union Alpha, Jev de Typesafe, le framework Dream RSI de Google, Projects dans Claude Code et la course d'entraînement de Mimo 2.6 de Xiaomi. Aucune d'elles n'est arrivée sous forme de lancement officiel ; chacune a émergé via des tests fantômes sur Arena, des listes de quotas sur Google Cloud, des essais gratuits de harness ou des journaux de recherche publics. Pour moi, c'est là la vraie histoire de la semaine : la manière dont les modèles sont testés est devenue aussi digne d'intérêt que les modèles eux-mêmes.
Gemini 4 Pro en test fantôme sur Arena
La trace la plus claire pour Google est un checkpoint qui circule sur Arena sous le nom de Gemini 3.8 Flash. Lorsqu'un utilisateur a lancé un test de stress JSON infini demandant mille planètes avec des détails denses, le vrai Flash a résumé puis abandonné, tandis que ce checkpoint continuait à produire des enregistrements détaillés et non répétitifs jusqu'à atteindre la limite de caractères du navigateur et faire planter la page. Cette endurance correspond à une limite de sortie de 256k tokens fuitée et attribuée à Gemini 4 Pro, ce qui renforce l'hypothèse qu'il s'agit du checkpoint flagship. La vidéo explique aussi comment l'essayer — se connecter à Arena, ouvrir le mode Battle et choisir Code — et souligne que même au niveau de raisonnement le plus bas d'Arena, les sorties semblent étonnamment solides, laissant penser que la capacité au lancement pourrait être encore supérieure.
Les sorties créatives du checkpoint constituent le cœur du point. Un jeu fluide façon Mario Kart avec génération de monde, une voiture de Formule 1 rendue en 3D avec des éclairages et des angles de caméra variés, un temple en voxel-art complet avec feuilles de cerisier qui tombent, des poissons dans la rivière et un cycle jour/nuit complet, et une PlayStation 5 en SVG pur — le tout présenté comme inhabituellement soigné pour Arena. L'exemple le plus commenté est un SVG animé d'une Nintendo Switch où les manettes se clipsent dans le corps et où l'écran démarre avec le logo ; l'animateur dit que Gemini 4 Pro a clairement surpassé Opus 5 sur ce prompt. Une génération SVG de dix minutes montrant de la profondeur, plusieurs points de vue, la lueur du bouton mute et même un calque de squelette, plus un prompt côte à côte d'un pélican sur un vélo où GPT-6 Astra garde l'avantage en profondeur visuelle, démontrent ensemble que le niveau de raisonnement de base du checkpoint fantôme est déjà compétitif face aux meilleurs modèles — alimentant le récit du retour de Google tout en laissant la vérification indépendante ouverte.
GPT-6 Soul : date limite, paliers et premières impressions
Côté OpenAI, le point présente GPT-6 Soul comme un palier d'efficacité à court terme avant la Dev Day. Sa date limite de connaissances est décrite comme le 30 avril, la même date attribuée à GPT-6 Astra, suggérant une lignée commune, les paliers inférieurs s'appelant peut-être Luna et Terra. Soul serait entré en test gris dans l'application web ChatGPT, où les premiers testeurs rapportent un formatage plus riche et une mémoire et une personnalisation nettement meilleures. Un SVG de manette PS5 généré avec un effort de raisonnement élevé en environ trois minutes et un intérieur de maison en 3D codé dans un environnement proche de 3GS sont présentés comme des signes que même le palier le moins cher approche la qualité d'Astra. L'animateur relaie aussi des affirmations selon lesquelles Soul a battu le Claude Opus 5.2 non encore publié sur quelques prompts tout en utilisant moins de tokens — mais il met en garde : ce sont des impressions précoces non vérifiées, pas des benchmarks, et le prix face à Astra ainsi que la vitesse réelle ne seront clairs qu'au lancement.
Grok 4.7 apparaît dans les quotas cloud
Pour Grok, le signal est son apparition dans les quotas et limites système de Google Cloud. Combiné au précédent « coming soon » d'Elon, cette entrée est interprétée comme une sortie imminente, même si la fenêtre initiale de dix jours a déjà glissé. Les premiers chiffres cités dans la vidéo placent Grok 4.7 à 6,4 sur Colony Bench Mega, un net bond par rapport à Gemini 3.8 Flash à 2,7 et GPT-5.6 Soul à 2,6, mais encore bien loin derrière GLM 5.3, DeepSeek 4.1 Flash, GPT-6 Astra Pro et Claude Fable 5. Côté CUDA, le tableau est plus serré : 9,5 sur le test fusionné GLM 5.2, juste au-dessus des 9,4 de Grok 4.6, avec de petits gains sur d'autres charges de travail CUDA. L'analyse de l'animateur est équilibrée — un vrai pas en avant par rapport à 4.6, mais souvent marginal — et suggère d'attendre des reruns indépendants avant d'extrapoler.
Union Alpha démasqué : Pareto 269 et la vérité sur le harness
La plus grande énigme de la semaine, Union Alpha, a été résolue juste après le montage principal. Présenté au départ comme un modèle furtif disponible gratuitement via OpenCode, OpenRouter et Klein, avec une fenêtre de contexte de 256k, un support multimodal et une orientation codage agentique, on lui créditait des performances proches d'Astra et d'Opus 5 pour environ un dix-huitième du coût attendu. La révélation ultérieure l'identifie comme Pareto 269 d'Unbiased — non pas un modèle unique mais un système qui répartit le travail entre plusieurs modèles ouverts et de frontière, dans l'esprit du précédent dispositif Sukuna. Les tarifs annoncés sont de 2,50 $ par million de tokens d'entrée et 0,25 $ pour l'entrée en cache, 7,50 $ pour la sortie, soit prétendument moins d'un quart du prix catalogue d'Astra. Ce routage explique pourquoi il semblait si proche des modèles de frontière sur certaines tâches : le harness transmet le travail à ces modèles quand c'est nécessaire. Mon avis est qu'Union Alpha doit être jugé comme un produit d'orchestration plutôt que comme des poids ; la question critique est la transparence de la logique de routage, pas seulement le prix affiché.
Jev de Typesafe, développé avec Dio, se situe sur un axe totalement différent. Contrairement aux grands modèles de langage classiques qui génèrent du texte token par token, Jev prend une entrée non structurée et un ensemble prédéfini de sorties possibles et renvoie des décisions structurées avec des probabilités, en calculant tout en parallèle. Son approche d'entraînement s'appelle RLCD, apprentissage par renforcement pour décisions calibrées. Les benchmarks de l'entreprise affirment une rapidité 20 à 200 fois supérieure pour un coût 40 à 400 fois inférieur sur les flux de décision testés, avec un tarif de quatre cents par million de tokens d'entrée et des sorties gratuites — des affirmations qui devront être validées de manière indépendante. La limite clé est explicite : Jev ne génère pas de texte normal, donc ce n'est pas un remplaçant de GPT-6 Astra ou d'un modèle Claude ; il est plutôt positionné comme un compagnon qui gère des milliers de décisions bon marché et rapides autour d'un modèle de frontière — routage, classification, évaluation des sorties ou choix de la prochaine action d'un agent.
Dream RSI, Claude Projects et la course de RL publique de Xiaomi
Dream RSI de Google DeepMind est présenté comme une boucle proche d'être bouclée, mais qui ne l'est pas encore. Les poids du modèle ne s'améliorent pas directement ; l'agent qui explore la politique apprend de sa propre historique de tentatives de découverte et devient meilleur dans la recherche de solutions au fil du temps. La vidéo indique que la boucle a été démontrée sur les algorithmes, l'ingénierie de kernels GPU et le développement de modèles, ce qui suggère que l'amélioration de la politique se généralise au-delà d'une seule tâche. La nuance compte : il s'agit d'une amélioration récursive de la politique de recherche, pas d'une auto-amélioration récursive des poids, donc si l'étiquette RSI est excitante, le résultat est une étape contrôlée vers elle plutôt qu'une évolution autonome complète au niveau des poids.
Les nouveaux Projects de Claude dans Claude Code sont présentés comme une amélioration pratique pour le travail en déplacement : donnez à Claude plusieurs tâches dans une même conversation et il les répartit en threads parallèles qui continuent de tourner après la fermeture de votre ordinateur portable, avec une mémoire et des fichiers partagés synchronisés entre les threads. C'est actuellement en bêta limitée pour les abonnés Pro et Max, avec un déploiement plus large attendu — potentiellement avec Opus 5.2. Le Mimo 2.6 de Xiaomi, après près de six mois de silence, est décrit comme à mi-parcours d'une immense course d'apprentissage par renforcement qui augmente le calcul RL, les environnements agentiques multitâches et le calcul global, générant environ deux milliards de tokens par étape d'entraînement sur des milliers de rollouts parallèles. L'équipe serait en train de diffuser la course en public et d'ouvrir davantage de détails d'entraînement dans les semaines à venir, même si le modèle lui-même est encore à un ou deux mois.
Le point se termine par une courte démo de robot où GPT-6 Astra pilote des pas de danse, un rappel symbolique que les grands modèles s'étendent désormais de l'artisanat SVG à la chorégraphie physique. Pris ensemble avec les promotions de l'animateur pour sa newsletter, son benchmark et sa plateforme de vibe-coding, le tableau est clair : Google auditionne discrètement un retour via Arena, OpenAI superpose une famille pour réduire les coûts, xAI prépare une sortie via les quotas cloud, et Xiaomi gagne la confiance en ouvrant le journal d'entraînement. Ma leçon de la semaine est de ne pas y lire un vainqueur unique mais des stratégies de transparence concurrentes — quel test fantôme est le plus honnête, quel quota a fuité le plus tôt, quel journal enseigne le plus — c'est là que se joue la vraie compétition.
Moments clés
- Ouverture — huit gros titres en un seul point
- Test fantôme de Gemini 4 Pro et affirmation des 256k
- Générations 3D Mario Kart et Formule 1
- Temple en voxel avec détails du cycle jour/nuit
- PS5 en SVG pur — dix minutes de profondeur
- Pélican sur un vélo — côte à côte avec Astra
- Date limite de GPT-6 Soul et traces de test gris
- Quota Cloud de Grok 4.7 et premiers scores
- Union Alpha et la révélation Pareto 269
- Jev, Dream RSI, Claude Projects et Mimo 2.6
Commentaire de l’IA
"« Ce qui m'a frappé cette semaine, ce n'est pas un modèle en particulier mais la façon dont nous les découvrons : les runs fantômes sur Arena, les fuites de quotas sur Google Cloud et les journaux de RL publics ont tous transformé l'infrastructure de test elle-même en gros titre, plutôt que n'importe quelle date de lancement. »"
Évaluation de l’IA
Le meilleur argument à l'encontre de ce point est de tempérer la qualité des fuites. Les tests fantômes sur Arena tournent à un niveau de raisonnement inférieur et on tombe sur un checkpoint par hasard ; le SVG ou la 3D soignée que nous voyons peut être un meilleur cas trié sur le volet, pas la moyenne. Des chiffres comme une limite de sortie de 256k proviennent d'étiquettes, pas de mesures indépendantes. En déduire un retour complet de Google à partir d'une seule animation de Switch est donc excessif ; ce qui compte, c'est la répétabilité entre les runs et le taux d'échec, pas le best-of.
La deuxième lacune concerne la méthode et les limites de temps. Le test JSON des mille planètes montre de l'endurance, mais sans métriques de diversité, de cohérence et de vraie non-répétition, cela pourrait aussi être une démonstration de mémorisation. Le SVG de squelette de la PS5 est impressionnant, mais il a pris dix minutes et fait planter un navigateur à la limite de caractères — des coûts qui peuvent ne pas être acceptables en usage réel et qui posent des questions pratiques de latence et de stabilité. Les scores Colony Bench et CUDA de Grok 4.7 sont de même précoces et étroits ; le tableau pourrait changer sur d'autres domaines, le long contexte ou les tests de sécurité. La démarche prudente est de traiter ces éléments comme des signaux, pas des verdicts, jusqu'à l'apparition de reruns indépendants.
Sur le plan des motivations et de la vérifiabilité, chaque titre relève de la gestion des attentes : les traces de Gemini reposent sur des partages d'utilisateurs anonymes, GPT-6 Soul sur des observations de test gris, Grok sur une entrée Cloud, et Union Alpha sur un harness d'abord présenté comme un modèle gratuit. Les tarifs de Pareto 269 semblent très attractifs, mais si une partie du travail est routée vers des modèles de frontière, le prix que vous payez et le coût du modèle qui a réellement fait le travail ne sont pas les mêmes ; sans journal de routage transparent, les comparaisons de coûts induisent en erreur. L'affirmation de Jev d'un gain de vitesse de 20 à 200 fois et d'une réduction de coût de 40 à 400 fois est également mesurée sur les propres flux de l'entreprise et nécessite un benchmarking indépendant avant toute généralisation.
Mon conseil pratique est de rendre trois habitudes routinières dès maintenant : sonder le checkpoint fantôme sur Arena avec le même prompt plusieurs fois, surveiller les quotas Cloud pour Grok, et lire les journaux de RL publics de Xiaomi. Mais ne pariez pas sur l'échantillon le plus brillant d'une seule vidéo au moment de décider. Si vous prototypez, testez le fantôme Gemini avec le même prompt SVG de façon répétée, mesurez les gains de mémoire et de formatage de Soul sur vos propres données, attendez la sortie officielle de Grok 4.7, budgétez Union Alpha comme de l'orchestration plutôt que comme des poids, et pilotez Jev uniquement comme couche de décision en sachant qu'il ne peut pas générer de texte.
Sources
11 liens ; 3 d’entre eux sont aussi cités par 19 autres articles. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
- @youtube https://www.youtube.com/watch?v=ZJ6RUAH--Js
- @officechai https://officechai.com/ai/gemini-4-0-pro-arena/
Également cité par : The costume on Arena: Gemini 4 traces leaking under the Gemini 3.8 Flash label
- @finance https://finance.biggo.com/news/66df2f89-c067-43d7-b888-94deb071f472
- @openai https://openai.com/index/gpt-6-astra/
Également cité par : Brain and Body: A Single-Screen Agent Setup with GPT-6 Astra on Hermes · Space Bunny Alpha: Inside OpenRouter's Free Anonymous AI Experiment · Robot-Use Agents: Why General-Purpose Models May Win Robot Control · Building a Productive Card Collection App in Minutes with Base44 and GPT-6 Astra · Price War Begins: GPT-6 Sol and Luna Halve Model Costs · Gemini 4 Leak? 10 Interactive 3D Tests Against GPT-6 Astra and Fable 5.1 · 10,000 Agents, 88 Hours, $1 Million: AI Mastermind #39 From Code to Cash to Autonomy · Cloning a Channel With One Prompt: The $33K Video Factory Built on GPT-6 Astra and Higgsfield · GPT-6 Astra Guide: How Horizontal Power Turns the Model Into Work Done · From Hand Sketch to Realistic Villa: A Showcase Video with GPT-6 Astra and Higgsfield MCP · The $500-a-Day Claim With GPT-6 Astra: Building Three Business Models End to End · When Agents Take the Job: Investing in the Stack After GPT-6 Astra (+5)
- @ccleaks https://ccleaks.com/news/openai-gpt-6-astra-launch-sep-2026
- @digg https://digg.com/ai/wityfrzg
- @gigazine https://gigazine.net/gsc_news/en/20260918-union-alpha/
- @theregister https://www.theregister.com/ai-and-ml/2026/09/16/typesafe-ai-debuts-model-for-machines-that-plays-doom/
- @aimodeling https://www.aimodeling.com/en/news/slug/dream-rsi-replay-simulator
Également cité par : Did Google Just Dream Its Way to Self-Improvement? Inside Dream RSI and the Intelligence Explosion Debate
- @forkast https://forkast.news/xiaomi-mimo-v2-6-breaks-cover-a-1t-class-chinese-lab-trains-in-public/
- @digitaltoday https://www.digitaltoday.co.kr/en/view/103667/musk-admits-grok47-not-better-than-rivals-teases-agi-with-grok5
gemini 4 pro · gpt-6 soul · grok 4.7 · union alpha · pareto 269 · dream rsi · mimo 2.6