Dans « Google is SO back… », Wes Roth présente le pari de Google comme le fait de rêver la RSI plutôt que de la vivre : tandis que beaucoup débattent de savoir si la RSI devrait avoir lieu, Google place l'IA dans une simulation et rêve à travers des milliers de voies d'amélioration pour voir quelle branche y arrive le plus vite. L'article au centre, Dream-RSI — le « R » pour simulation — ne cherche pas à remplacer l'agent de codage ; il cherche à améliorer la politique d'exploration qui décide quelle expérience l'agent doit lancer ensuite, transformant la méta-décision en principal objectif d'optimisation.
Pourquoi la découverte se comporte comme un arbre technologique
La métaphore de l'arbre technologique, empruntée aux jeux vidéo, rend l'idée intuitive : comme fabriquer des outils en bois avant la pierre et le diamant dans Minecraft, la science a besoin de prérequis. Wes esquisse l'arbre de l'humanité, des outils en pierre aux lames polies, puis aux wikis, DVD, Wi-Fi, GPU, et enfin à la pile 2025 composée du chatbot LM, du modèle de raisonnement et de l'agent de codage IA comme frontière actuelle. Certaines branches semblent prometteuses et meurent, d'autres semblent accidentelles et deviennent des bonds ; l'arbre continue de se ramifier, et choisir la branche est la véritable compétence.
Cette histoire explique les oscillations du pendule. Dans les années 80 et 90, beaucoup ont rejeté les réseaux de neurones comme des impasses, jusqu'à ce que Geoffrey Hinton soutienne que le goulot d'étranglement était la puissance de calcul et que les GPU de Jensen Huang lui donnent raison. La même scission est revenue avec les grands modèles de langage : un camp l'a qualifiée de mauvaise route vers l'AGI et voulait l'arrêter, l'autre a mis à l'échelle ce qui semblait fonctionner et a été validé, du bout des lèvres. Dream-RSI systématise ce choix : même un excellent chercheur peut perdre une semaine sur la mauvaise chaîne, donc le levier n'est pas seulement de meilleures expériences mais de meilleures décisions sur lesquelles méritent l'énergie, le calcul et l'attention.
La réponse : l'histoire est déjà un simulateur
La proposition de Google et de ses collaborateurs est d'une simplicité désarmante : toutes ces expériences passées, avec la lignée indiquant quelle découverte dépendait de laquelle, sont déjà des données — une carte. Le site la distille en trois idées : l'histoire fournit le monde où le rêve se produit, le rêve alimente l'étape d'auto-amélioration, et chaque tour réussi contribue un nouveau monde. Il n'y a ni modèle du monde appris ni approximation ; l'arbre déjà cultivé par l'agent fonctionne comme un moteur de rejeu précis du territoire qu'il a couvert, un monde acquis gratuitement comme effet secondaire du travail.
En pratique, on rembobine l'histoire à un point donné et on laisse l'agent parcourir l'arbre historique. Wes rappelle l'expérience de pensée de Demis Hassabis : entraîner jusqu'au début des années 1900 et demander si l'agent redériverait la relativité, ou plus directement pour cet article, s'il pourrait accélérer la découverte en trouvant des branches plus rapides dans le même arbre. Dream-RSI rend cela concret : rêver des milliers de politiques candidates contre ce monde à zéro exécution et ne déployer que la gagnante. L'analogie avec Mario aide — un milliard de Marios convergent vers les tactiques qui fonctionnent — sauf qu'ici les Marios apprennent où se ramifier, quoi paralléliser et quand arrêter la recherche.
Boucler la boucle : un bassin croissant de mondes
La boucle comporte trois étapes. Exploration en ligne : la politique actuelle guide l'agent de codage, développe l'arbre de découverte et enregistre les traces. Construction du simulateur : cet arbre, avec ses décisions de ramification et ses résultats d'exécution de code, devient un bassin réutilisable de simulateurs de rejeu. Amélioration de la politique par le rêve : un agent de développement de politiques rêve des politiques d'exploration alternatives et les rejoue pour un retour rapide, puis livre la meilleure. Chaque déploiement gagnant enregistre un nouvel arbre, si bien que l'agent ne possède pas un seul monde mais un bassin croissant ; une politique évaluée sur un ensemble plus large de mondes surpasse celle ajustée au résultat aléatoire d'une seule exécution et atteint des mondes qu'aucune stratégie antérieure n'aurait pu rejoindre — les mondes évoluent avec l'agent.
L'attrait, c'est le coût. Évaluer une politique d'exploration signifie normalement la regarder guider une exécution entière à long terme jusqu'au bout ; le retour est retardé et coûteux, et l'espace des méta-politiques est vaste et majoritairement mauvais. Un script d'exploration fixe, écrit à la main, ne peut pas apprendre de l'expérience et continue de payer pour des directions déjà échouées. En lisant l'histoire comme un arbre plutôt que comme du texte statique ou des données d'entraînement, Dream-RSI transforme les enregistrements passés en un simulateur où une nouvelle stratégie peut parcourir différentes branches dans différents ordres avec différentes règles de concurrence et d'arrêt, le tout sur des nœuds déjà exécutés. L'évaluation revient immédiatement à zéro exécution supplémentaire, ce qui permet à une seule exécution en ligne coûteuse de payer des milliers d'évaluations hors politique.
Ce que montrent les chiffres et comment le comportement s'adapte
Est-ce que ça marche ? D'après les points forts de dream-rsi.com sur huit tâches dans trois domaines, la base de comparaison contrôlée est l'Exploration Fixe Récursive — agent, évaluateur et budget identiques, mais la politique ne change jamais, donc le premier tour est identique par construction. Dream-RSI rapporte 2,43× moins de générations sur VGG16 à performance comparable, 2,09× de score supérieur sur ConvDiv à budget comparable, et 162× moins d'appels à l'agent de découverte que SimpleTES sur Lasso. Le tableau Lasso est concret : avec Gemini-3.7-Flash, Dream-RSI atteint en moyenne 2 350,6 ms de temps d'exécution hors échantillon à 1 879 appels cumulés, contre 2 516,7 ms à 3 200 appels pour l'exploration fixe et 3 804,8 ms à 51 200 appels pour SimpleTES avec gpt-oss-120b ; Gemini-3.1-Pro montre la même direction.
Deux observations comportementales ressortent de la lecture du graphique par Wes. L'approche est adaptative : quand le progrès est facile, elle dépense moins de calcul ; quand il stagne, elle en dépense plus. Et tenter de guider l'agent avec des conseils issus de son passé aggrave les choses — l'exploration ouverte fonctionne le mieux, ce qui soutient l'idée de comparer des routes entières sur la carte plutôt que de copier la route précédente. La vidéo note aussi qu'AlphaEvolve bat Dream-RSI sur certaines optimisations mathématiques, mais ce n'est pas une contradiction ; les outils visent des tranches différentes de la RSI et peuvent être combinés plutôt que classés comme substituts directs.
La conclusion revient à la pile RSI plus large de Google. La victoire antérieure d'AlphaEvolve sur l'ordonnancement des centres de données Borg — une optimisation non théorique que Wes rappelle comme ayant permis d'économiser des millions en mieux organisant le bassin mondial de calcul de Google — est la pièce complémentaire : un système exécute les expériences, un autre détermine comment ordonnancer quelle expérience s'exécute ensuite, et ensemble ils améliorent la prochaine génération de modèles, d'outils et de processus. Dans cette architecture, Dream-RSI est le formateur de rêve de l'ordonnanceur : une couche d'orchestration légère qui rend explicites et programmables la ramification, le parallélisme et l'arrêt, tout en laissant l'agent de codage inchangé. C'est pourquoi Wes le qualifie de fondationnel plutôt que de spectaculaire — non pas un nouveau modèle prêt à l'emploi mais la couche qui permet aux modèles de continuer à s'améliorer, un levier plausible suivant du laboratoire qui a inventé le transformer.
Moments clés
- Ouverture — pourquoi Google rêve la RSI au lieu de l'exécuter
L'histoire offre le monde où le rêve se produit
- Arbre technologique — de Minecraft à la découverte humaine
- L'idée Dream-RSI — l'histoire accumulée est une donnée gratuite
Le passé accumulé est déjà un simulateur
- Mécanique du rêve — des milliers de candidats à coût nul
Chaque rêve sauf le gagnant est gratuit
- Chaque tour ajoute un monde — le bassin continue de croître
- Résultats — calcul adaptatif, le score le plus bas gagne
Commentaire de l’IA
""Ce qui me frappe dans Dream-RSI, ce n'est pas un modèle plus grand mais une recherche plus intelligente : traiter l'histoire que nous avons déjà comme un simulateur fait passer l'auto-amélioration récursive d'un essai-erreur coûteux à une répétition mentale bon marché.""
Évaluation de l’IA
Renforçons l'objection la plus solide : la revendication de « simulateur exact » de Dream-RSI n'est exacte qu'à l'intérieur du sous-espace visité. Le monde de rejeu est précis là où l'histoire est allée et muet là où elle n'est jamais allée. Si les explorations précoces étaient étroites ou biaisées, une politique qui semble brillante en rêve peut trébucher une fois déployée sur un territoire vraiment nouveau. Comme le note le dossier d'août 2026 du MIT Technology Review sur l'auto-amélioration récursive, le rythme de la RSI est souvent limité non par les nouvelles idées mais par le coût et la confiance de l'évaluation — le simulateur supprime le coût mais ne garantit pas la nouveauté.
La méthodologie a une limite claire : l'évaluation est solide sur des tâches bien définies à horizon court ou moyen (Lasso, ConvDiv, VGG16), mais son économie dans une découverte très longue et ouverte reste incertaine. Les tableaux rapportent le temps d'exécution moyen hors échantillon comme qualité aval, alors que les déploiements réels doivent aussi optimiser en parallèle la sécurité, la reproductibilité et le coût de maintenance. La note de mai 2026 de TechCrunch selon laquelle « la RSI est le nouvel AGI » rappelle que la définition comme la métrique de l'amélioration restent floues — ce qui compte comme un meilleur score change la donne.
Pour la provenance et la vérifiabilité, séparez les preuves primaires du ratio accrocheur. La source principale est un rapport technique de Google et DeepMind et son site ; la réplication indépendante reste limitée et le dépôt GitHub vient tout juste d'ouvrir. Des ratios comme « 162× moins d'appels » reposent sur une comparaison contrôlée avec agent et évaluateur identiques ; changez l'un ou l'autre et le ratio bouge. Au moment de décider, je vérifierais les deux chiffres porteurs — le temps d'exécution moyen sur Lasso et les générations sur VGG16 — contre les tableaux HTML d'arXiv et la Fig. 3(b) sur dream-rsi.com, et j'éviterais de supposer que les mêmes économies se transfèrent telles quelles à un système de production fermé comme Borg.
Mon avis pratique : Dream-RSI est un levier immédiatement testable pour les équipes où le budget d'exploration est serré et les traces historiques riches — obtenir une qualité similaire ou meilleure avec moins d'appels sur des tâches d'algorithmes et de noyaux raccourcit directement les feuilles de route. Là où l'histoire est mince, le projet est vierge ou l'espace reste non cartographié, le bassin de rêves est peu profond ; dans ce cas, diversifier délibérément pour tracer d'abord la carte, puis rêver, est plus sain. Je le résume ainsi : « d'abord la carte, ensuite le rêve » — la patience jusqu'à ce que l'histoire devienne un simulateur, puis des rêves audacieux une fois qu'elle l'est.
Sources
8 liens ; 1 d’entre eux sont aussi cités par 2 autres articles. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
- @youtube https://www.youtube.com/watch?v=thR9_VYJiQo
- @arxiv https://arxiv.org/abs/2609.14858
Également cité par : The costume on Arena: Gemini 4 traces leaking under the Gemini 3.8 Flash label · Did Google Just Dream Its Way to Self-Improvement? Inside Dream RSI and the Intelligence Explosion Debate
- @dream-rsi https://www.dream-rsi.com/
- @arxiv https://arxiv.org/html/2609.14858v1
- @technologyreview https://www.technologyreview.com/2026/08/18/1142188/ai-recursive-self-improvement/
- @techcrunch https://techcrunch.com/2026/05/28/rsi-is-the-new-agi-and-its-just-as-hard-to-pin-down/
- @deepmind https://deepmind.google/blog/alphaevolve-impact/
- @github https://github.com/zhengkid/Dream-RSI
dream-rsi · auto-amelioration-recursive · google-deepmind · politique-d-exploration · simulateur · alphaevolve · gemini