En 1965, el criptógrafo de Bletchley Park I. J. Good, que había trabajado junto a Turing, escribió que en cuanto una máquina pudiera diseñar a sus sucesores, comenzaría una explosión de inteligencia y el intelecto humano quedaría atrás. La idea circula hoy como RSI (auto-mejora recursiva — un sistema que mejora su propia capacidad de mejorar), y se divide en dos lecturas: la RSI fácil automatiza la I+D y reemplaza a los investigadores humanos; la RSI difícil hace que el propio modelo sea más eficiente en cómputo o datos al reescribir directamente sus pesos o su arquitectura. La encuesta de Lilian Weng del 4 de julio sobre Harness Engineering afila esa distinción al revisar unos 35 artículos y argumentar que la palanca real no es el modelo sino el arnés — el andamiaje de evaluación, selección y orquestación alrededor del modelo. Como un buen taller donde el banco sobrevive al artesano, el arnés sostuvo los titulares matemáticos de este año.
El mapa de cinco etapas de Pekín: la última IA construida por humanos
La semana pasada, 33 investigadores liderados por ByteDance, Tsinghua y el Shanghai AI Laboratory publicaron The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement, que gradúa la RSI en cinco etapas. 1) La IA simplemente ejecuta un procedimiento de mejora escrito por humanos, 2) elige cómo mejorarse, 3) decide qué nueva información o experiencia adquirir, 4) se adapta tras el despliegue a cambios de distribución, 5) refina persistentemente los propios métodos usados para mejorar la IA. Los autores subrayan un filtro: corregir una sola respuesta no es RSI; las mejoras deben persistir más allá de una tarea y ser heredadas por los sucesores. La apuesta competitiva es clara: automatizar el ciclo de vida intensivo en mano de obra del entrenamiento y el ajuste acorta los ciclos y reduce costos, lo que en la carrera EE. UU.–China se lee como exprimir más rendimiento de un hardware escaso.
El verdadero motor: el bucle de descubrimiento de AlphaEvolve
Los titulares matemáticos del verano — la conjetura jacobiana, el empuje sobre Navier-Stokes y los avances en la hipótesis de Riemann — comparten un patrón: ningún modelo caminó solo. AlphaEvolve de Google DeepMind (mayo de 2025) lo institucionalizó. Gemini Flash barre en amplitud, Gemini Pro añade profundidad, mientras evaluadores automatizados puntúan cada programa y una base de datos de programas evolutivos decide qué ideas siembran el siguiente prompt. El bucle tiene tres pasos: 1) proponer — el agente escribe código, 2) medir — el evaluador registra la puntuación y los fallos, 3) seleccionar y retroalimentar — los programas más prometedores moldean el siguiente prompt. El beneficio se derramó fuera del laboratorio: la eficiencia de los centros de datos, el diseño de chips e incluso el propio proceso de entrenamiento de los LLM mejoraron bajo el mismo bucle. La sorpresa no está en el modelo, sino en el arnés que lo dirige.
El cuello de botella que nadie menciona: la política de exploración
Dentro de cada bucle se esconde un tomador de decisiones silencioso: la política de exploración — el conjunto de reglas que decide dónde ramificar a continuación, qué ejecutar en paralelo y cuándo cortar una línea muerta. El video lo ilustra con el emparejamiento de caballos — si un intento empareja caballos ligeramente mejor, ¿debe el agente redoblar la apuesta o reiniciar? Si un intento falla antes de un solo emparejamiento, ¿culpa de la idea o de la implementación? Hasta la semana pasada esa política estaba codificada a mano por quien montaba el bucle; una estrategia fija no puede aprender de la experiencia acumulada y sigue pagando por direcciones que ya fracasaron. Como chocar contra la misma pared de un laberinto, vuelve a facturar el fracaso. Dos muros se alzan juntos: la retroalimentación de la política es tardía y costosa — hay que observar una corrida de descubrimiento completa para juzgar una política — y el espacio de políticas es vasto, así que la mayoría de las candidatas que habría que probar son malas y cuestan un despliegue completo para exponerse.
Cómo sueña Dream RSI en tres pasos
Diecisiete investigadores de Google, DeepMind, Maryland y Virginia atacan ese cuello de botella en Dream-RSI: Recursive Self-Improvement through Evolving Worlds (arXiv:2609.14858, 14 de septiembre) sin tocar los pesos. Funciona en la capa de orquestación y se repite en tres pasos: 1) Exploración en línea — un agente de código congelado (Gemini 3.1 Pro / 3.7 Flash en el artículo) resuelve un problema real mientras cada decisión se almacena como un nodo de árbol de descubrimiento que lleva el código, la puntuación y una bandera de fallo. 2) Simulador de repetición — un simulador ligero que trata el árbol grabado como un mundo determinista — una corrida terminada ya no es texto sino un árbol estructurado; una nueva política nunca re-ejecuta nada, recorre el mismo árbol en un orden distinto y cada resultado que pide ya está en disco. Este simulador no es un modelo del mundo aprendido; es exacto donde pasó la historia, sin predicción alguna. 3) Refinamiento de la política mediante sueños — un agente desarrollador de políticas fijo genera decenas de políticas candidatas, cada una repetida a costo de ejecución cero sobre todos los árboles históricos; la fórmula de puntuación premia la calidad de las soluciones, penaliza los nodos revelados (costo real) y premia el paralelismo, y la mejor soñadora se redepliega en línea. Cada despliegue hace crecer un árbol nuevo, así que la política elegida es la que gana en un conjunto de mundos, no la suerte de una sola corrida.
¿Por qué es tan barato? Porque la factura ya está pagada. Cuando el único trabajo de una política es releer la historia en un orden distinto, miles de candidatas cuestan lo mismo que recorrer registros en disco en lugar de miles de corridas completas. La tarjeta de presentación del artículo dice que el equipo recopila historias en línea, construye simuladores a partir de ellas, refina la metaestrategia de exploración mediante sueños y la redespliega. Como memorizar el árbol de jugadas de una partida de ajedrez y luego probar miles de variantes en la cabeza sin tocar el tablero, encuentras la mejor apertura sin riesgo. El límite viene del mismo lugar: el simulador es exacto solo donde la historia pasó; una rama nunca visitada no puede soñarse, por eso el bucle debe seguir produciendo historia fresca.
Qué cambió en ocho tareas: lasso y 162 veces menos llamadas
El equipo ejecutó la misma configuración dos veces — fija frente a soñadora — en ocho tareas de diseño de algoritmos y matemáticas. El titular es un solucionador de lasso (regresión dispersa — el algoritmo que elige el modelo más simple y preciso entre cientos de variables, como cocinar el mejor plato con los menos ingredientes) que supera la biblioteca estándar de Python de machine learning; la política soñadora lo encontró en unos 300 intentos, la fija necesitó 550, y el mejor método anterior tomó unos 51.000. El artículo y resúmenes independientes lo reportan como hasta 162 veces menos llamadas de búsqueda. Un pequeño detalle del prompt importa: se pide explícitamente al agente que lea todos los intentos pasados antes de escribir código, que evite retoques mínimos a la misma idea y que prometa no matar procesos — un cambio mínimo de redacción que produce un gran giro estratégico. Por ejemplo, en un conjunto de datos de 500 características, cada intento propone un nuevo programa de poda de coeficientes; la política soñadora descarta una familia de poda que falló 200 veces en la historia sin volver a presentarla jamás, mientras que la fija todavía gasta 40 intentos más dentro de la misma familia.
Comentario de la IA
""Lo que me importa no es que el modelo sea más grande, sino que la capa de control de búsqueda madure en los sueños; cuando los pesos permanecen congelados y la estrategia aprende, la retórica de la explosión de inteligencia se enfría hasta convertirse en un libro de contabilidad de ingeniería.""
Evaluación de la IA
La mejor síntesis del video lo capta bien: soñar la política mientras los pesos permanecen congelados no es una explosión de inteligencia al estilo de Good, pero sí es una palanca medible en ingeniería. En su mejor momento refleja a un investigador de posgrado revisando la estrategia matutina contra los registros de la noche — el modelo sigue igual de listo, pero el desperdicio de búsqueda cae. Ese steelman reencuadra Dream RSI del hype a una mejora duradera en la capa del arnés.
Los límites son nítidos. El simulador es exacto solo donde la historia pasó; una idea brillante nunca probada no puede soñarse. La evaluación también sigue atada a puntuadores escritos a mano — superar a sklearn en lasso es significativo, pero si el puntuador es estrecho, la política puede manipularlo y perder la generalización real. Finalmente, cuando el propio evaluador se basa en un modelo, como con razonadores tipo o3, el cálculo de costos cambia; aunque soñar sea gratis, la validación final sigue siendo cara.
La procedencia se divide. La narración de Fireship comprime Dream RSI en un solo video, mientras que arXiv:2609.14858 y el mapa de cinco etapas de ByteDance ponen lado a lado, en la misma semana, definiciones distintas de RSI — una mide la orquestación, la otra una escalera de autonomía. La repetición independiente necesita tres comprobaciones: a) ¿el código y los puntuadores de las ocho tareas detrás de la afirmación de 162x están abiertos, b) ¿la misma fórmula de puntuación de sueños se sostiene tanto en optimización combinatoria como continua, c) ¿la política se ajusta a todo el conjunto o a la suerte de un solo árbol? Sin eso, la retórica de la explosión es prematura.
Las conclusiones prácticas divergen. Para equipos de matemáticas y algoritmos, Dream RSI es utilizable de inmediato con un agente de código congelado dondequiera que el evaluador sea barato y determinista — los registros nocturnos se convierten en la estrategia matutina. Para agentes de producto y de propósito general con evaluadores costosos, abiertos o basados en retroalimentación humana, el conjunto de sueños se vuelve superficial rápidamente y el humano en el bucle sigue siendo el factor de costo. Quién se beneficia depende, pues, de cuán barato y confiable sea tu puntuador.
Fuentes
7 enlaces; 2 de ellos también citados por 3 otras noticias. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
- @youtube https://www.youtube.com/watch?v=LoLYw--s-5w
- @arxiv https://arxiv.org/abs/2609.14858
También citado por: The costume on Arena: Gemini 4 traces leaking under the Gemini 3.8 Flash label · Google's Dream RSI: Turning History into a Simulator for Recursive Self-Improvement
- @aimodeling https://www.aimodeling.com/en/news/slug/dream-rsi-replay-simulator
También citado por: Gemini 4 Pro Leaks, GPT-6 Soul in Testing: From Arena to Google Cloud, the Week's AI Shockwave
- @shattered https://shattered.io/dream-rsi-recursive-self-improvement-2026/
- @deepmind https://deepmind.google/blog/alphaevolve-a-gemini-powered-coding-agent-for-designing-advanced-algorithms/
- @thestar https://www.thestar.com.my/aseanplus/aseanplus-news/2026/09/16/chinese-researchers-chart-5-stage-path-toward-last-ai-built-by-humans
- @channelnewsasia https://www.channelnewsasia.com/east-asia/chinese-researchers-map-out-five-stage-plan-ai-improve-without-human-intervention-6393996
dream rsi · rsi · alpha evolve · google deepmind · bytedance