En «Google is SO back…», Wes Roth enmarca la apuesta de Google como soñar la RSI en lugar de vivirla: mientras muchos debaten si la RSI debería ocurrir, Google pone la IA en una simulación y sueña a través de miles de vías de mejora para ver qué rama llega más rápido. El artículo central, Dream-RSI — la «R» de simulación — no intenta reemplazar al agente de codificación; intenta mejorar la política de exploración que decide qué experimento debe ejecutar el agente a continuación, convirtiendo la meta-decisión en el principal objetivo de optimización.
Por qué el descubrimiento se comporta como un árbol tecnológico
La metáfora del árbol tecnológico, tomada de los videojuegos, hace la idea intuitiva: como fabricar herramientas de madera antes que de piedra y diamante en Minecraft, la ciencia necesita prerrequisitos. Wes esboza el árbol de la humanidad desde las herramientas de piedra hasta las hojas pulidas, luego wikis, DVD, Wi-Fi, GPU, y finalmente el stack de 2025 de chatbot LM, modelo de razonamiento y agente de codificación de IA como frontera actual. Algunas ramas parecen prometedoras y mueren, otras parecen accidentales y se convierten en saltos; el árbol sigue ramificándose, y elegir la rama es la verdadera habilidad.
Esa historia explica los vaivenes del péndulo. En los 80 y 90 muchos descartaron las redes neuronales como callejones sin salida hasta que Geoffrey Hinton argumentó que el cuello de botella era la computación y las GPU de Jensen Huang le dieron la razón. La misma división regresó con los grandes modelos de lenguaje: un bando lo llamó el camino equivocado hacia la AGI y quiso cerrarlo, el otro escaló lo que parecía funcionar y fue reivindicado, aunque a regañadientes. Dream-RSI sistematiza esa elección: incluso un investigador excelente puede desperdiciar una semana en la cadena equivocada, así que la palanca no son solo mejores experimentos sino mejores decisiones sobre qué experimentos merecen energía, cómputo y atención.
La respuesta: la historia ya es un simulador
La propuesta de Google y sus colaboradores es de una simplicidad desarmante: todos esos experimentos pasados, con el linaje de qué hallazgo dependía de cuál, ya son datos — un mapa. El sitio lo destila en tres ideas: la historia proporciona el mundo donde ocurre el sueño, el sueño impulsa el paso de auto-mejora, y cada vuelta exitosa aporta un nuevo mundo. No hay modelo del mundo aprendido ni aproximación; el árbol ya cultivado por el agente funciona como un motor de repetición preciso del territorio que ha cubierto, un mundo adquirido gratis como efecto secundario de hacer el trabajo.
En la práctica, se rebobina la historia hasta un punto y se deja que el agente recorra el árbol histórico. Wes recuerda el experimento mental de Demis Hassabis de entrenar hasta principios del siglo XX y preguntar si el agente rededuciría la relatividad, o más directamente para este artículo, si podría hacer speedrun del descubrimiento encontrando ramas más rápidas por el mismo árbol. Dream-RSI lo hace concreto: soñar miles de políticas candidatas contra ese mundo a cero ejecuciones y desplegar solo la ganadora. La analogía con Mario ayuda — mil millones de Marios convergen en las tácticas que funcionan — excepto que aquí los Marios aprenden dónde ramificarse, qué paralelizar y cuándo detener la búsqueda.
Cerrar el ciclo: un grupo creciente de mundos
El ciclo tiene tres etapas. Exploración en línea: la política actual guía al agente de codificación, expande el árbol de descubrimiento y registra trazas. Construcción del simulador: ese árbol, con sus decisiones de ramificación y resultados de ejecución de código, se convierte en un grupo reutilizable de simuladores de repetición. Mejora de la política basada en sueños: un agente de desarrollo de políticas sueña políticas de exploración alternativas y las reproduce para retroalimentación rápida, y luego envía la de mejor puntuación. Cada despliegue ganador registra un nuevo árbol, así que el agente no posee un solo mundo sino un grupo creciente; una política puntuada sobre un conjunto mayor de mundos supera a una ajustada al resultado azaroso de una sola ejecución y alcanza mundos que ninguna estrategia anterior habría podido llegar — los mundos evolucionan junto con el agente.
El atractivo es el coste. Juzgar una política de exploración normalmente significa verla guiar una ejecución completa de horizonte largo hasta el final; la retroalimentación es tardía y cara, y el espacio de meta-políticas es vasto y mayormente malo. Un script de exploración fijo, escrito a mano, no puede aprender de la experiencia y sigue pagando por direcciones que ya fracasaron. Al leer la historia como un árbol en lugar de como texto estático o datos de entrenamiento, Dream-RSI convierte los registros pasados en un simulador donde una nueva estrategia puede recorrer diferentes ramas en diferentes órdenes con diferente concurrencia y reglas de parada, todo sobre nodos ya ejecutados. La evaluación regresa de inmediato a cero ejecuciones extra, y así una costosa ejecución en línea puede pagar miles de evaluaciones fuera de política.
Lo que muestran los números y cómo se adapta el comportamiento
¿Funciona? Según los destacados de dream-rsi.com en ocho tareas de tres dominios, la línea base controlada es la Exploración Fija Recursiva — agente, evaluador y presupuesto idénticos, pero la política nunca cambia, así que la primera ronda es idéntica por construcción. Dream-RSI reporta 2,43× menos generaciones en VGG16 a rendimiento comparable, 2,09× mayor puntuación en ConvDiv a presupuesto comparable, y 162× menos llamadas al agente de descubrimiento que SimpleTES en Lasso. La tabla de Lasso es concreta: con Gemini-3.7-Flash, Dream-RSI promedia 2.350,6 ms de tiempo de ejecución fuera de muestra a 1.879 llamadas acumuladas frente a 2.516,7 ms a 3.200 llamadas de la exploración fija y 3.804,8 ms a 51.200 llamadas de SimpleTES con gpt-oss-120b; Gemini-3.1-Pro muestra la misma dirección.
Dos notas de comportamiento destacan en el recorrido de gráficos de Wes. El enfoque es adaptativo: cuando el progreso es fácil gasta menos cómputo, cuando se estanca gasta más. Y tratar de guiar al agente con consejos de su pasado empeora las cosas — la exploración abierta funciona mejor, lo que apoya la idea de comparar rutas completas en el mapa en lugar de copiar la ruta anterior. El video también señala que AlphaEvolve supera a Dream-RSI en algunas optimizaciones matemáticas, pero eso no es una contradicción; las herramientas apuntan a porciones distintas de la RSI y pueden combinarse en lugar de clasificarse como sustitutos directos.
El cierre vuelve al stack RSI más amplio de Google. La victoria anterior de AlphaEvolve en la programación del centro de datos Borg — una optimización no teórica que Wes recuerda como un ahorro de millones al organizar mejor el grupo global de cómputo de Google — es la pieza complementaria: un sistema ejecuta experimentos, otro averigua cómo programar qué experimento se ejecuta a continuación, y juntos mejoran la próxima generación de modelos, herramientas y procesos. En esa arquitectura, Dream-RSI es el entrenador de sueños del planificador: una capa de orquestación ligera que hace explícitas y programables la ramificación, el paralelismo y la parada, dejando intacto al agente de codificación. Por eso Wes lo llama fundacional en lugar de llamativo — no un modelo nuevo listo para usar sino la capa que permite a los modelos seguir mejorando, una palanca plausible del laboratorio que inventó el transformer.
Momentos clave
- Apertura — por qué Google sueña la RSI en lugar de ejecutarla
La historia ofrece el mundo donde ocurre el sueño
- Árbol tecnológico — de Minecraft al descubrimiento humano
- La idea Dream-RSI — la historia acumulada es dato gratis
El pasado acumulado ya es un simulador
- Mecánica del sueño — miles de candidatos a coste cero
Cada sueño salvo el ganador es gratis
- Cada vuelta añade un mundo — el grupo sigue creciendo
- Resultados — cómputo adaptativo, la puntuación más baja gana
Comentario de la IA
""Lo que me llama la atención de Dream-RSI no es un modelo más grande sino una búsqueda más inteligente: tratar la historia que ya tenemos como un simulador traslada la auto-mejora recursiva de la prueba y error costosa al ensayo mental barato.""
Evaluación de la IA
Fortaleciendo la objeción más sólida: la afirmación de «simulador exacto» de Dream-RSI solo es exacta dentro del subespacio visitado. El mundo de repetición es preciso donde la historia fue y silencioso donde nunca fue. Si las exploraciones tempranas fueron estrechas o sesgadas, una política que parece brillante en sueños puede tropezar al desplegarse en territorio verdaderamente nuevo. Como señala el repaso de agosto de 2026 de MIT Technology Review sobre la auto-mejora recursiva, el ritmo de la RSI a menudo está limitado no por ideas nuevas sino por el coste y la confianza de la evaluación — el simulador elimina el coste pero no garantiza la novedad.
La metodología tiene un límite claro: la evaluación es sólida en tareas bien definidas de horizonte corto a medio (Lasso, ConvDiv, VGG16), pero su economía en descubrimientos muy largos y abiertos sigue siendo incierta. Las tablas reportan el tiempo de ejecución promedio fuera de muestra como calidad aguas abajo, pero los despliegues reales también necesitan optimizar en paralelo la seguridad, la reproducibilidad y el coste de mantenimiento. La nota de mayo de 2026 de TechCrunch de que «la RSI es la nueva AGI» recuerda que tanto la definición como la métrica de mejora son difusas — lo que cuenta como mejor puntuación cambia el juego.
Para la procedencia y verificabilidad, separe la evidencia primaria del ratio titular. La fuente principal es un informe técnico de Google y DeepMind y su sitio; la replicación independiente sigue siendo limitada y el repositorio de GitHub acaba de abrirse. Ratios como «162× menos llamadas» se apoyan en una comparación controlada con agente y evaluador idénticos; cambie cualquiera y el ratio se mueve. A la hora de decidir, yo verificaría los dos números críticos — el tiempo de ejecución promedio de Lasso y las generaciones de VGG16 — contra las tablas HTML de arXiv y la Fig. 3(b) en dream-rsi.com, y evitaría asumir que los mismos ahorros se transfieren uno a uno a un sistema de producción cerrado como Borg.
Mi opinión práctica: Dream-RSI es una palanca inmediatamente comprobable para equipos donde el presupuesto de exploración es ajustado y las trazas históricas son ricas — obtener calidad similar o mejor con menos llamadas en tareas de algoritmos y kernels acorta directamente las hojas de ruta. Donde la historia es escasa, el proyecto es terreno virgen o el espacio sigue sin mapear, el grupo de sueños es superficial; ahí, diversificar deliberadamente para dibujar primero el mapa y luego soñar es más sano. Lo resumo como «primero el mapa, luego el sueño» — paciencia hasta que la historia se convierta en un simulador, y luego sueños audaces cuando lo haga.
Fuentes
8 enlaces; 1 de ellos también citados por 2 otras noticias. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
- @youtube https://www.youtube.com/watch?v=thR9_VYJiQo
- @arxiv https://arxiv.org/abs/2609.14858
También citado por: The costume on Arena: Gemini 4 traces leaking under the Gemini 3.8 Flash label · Did Google Just Dream Its Way to Self-Improvement? Inside Dream RSI and the Intelligence Explosion Debate
- @dream-rsi https://www.dream-rsi.com/
- @arxiv https://arxiv.org/html/2609.14858v1
- @technologyreview https://www.technologyreview.com/2026/08/18/1142188/ai-recursive-self-improvement/
- @techcrunch https://techcrunch.com/2026/05/28/rsi-is-the-new-agi-and-its-just-as-hard-to-pin-down/
- @deepmind https://deepmind.google/blog/alphaevolve-impact/
- @github https://github.com/zhengkid/Dream-RSI
dream-rsi · auto-mejora-recursiva · google-deepmind · politica-de-exploracion · simulador · alphaevolve · gemini