Este es el primer informe largo del presentador tras un mes lejos de su equipo habitual, y condensa ocho filtraciones distintas en un solo repaso: Gemini 4 Pro, GPT-6 Soul, Grok 4.7, Union Alpha, Jev de Typesafe, el framework Dream RSI de Google, Projects en Claude Code y la carrera de entrenamiento de Mimo 2.6 de Xiaomi. Ninguna llegó como un lanzamiento formal; cada una salió a la luz mediante pruebas fantasma en Arena, listados de cuotas en Google Cloud, pruebas gratuitas de harness o registros de investigación públicos. Para mí, esa es la verdadera historia de la semana: cómo se prueban los modelos se ha vuelto tan noticiable como los propios modelos.
Gemini 4 Pro en pruebas fantasma en Arena
El rastro más claro para Google es un checkpoint que circula en Arena bajo el nombre de Gemini 3.8 Flash. Cuando un usuario ejecutó una prueba de estrés JSON infinita pidiendo mil planetas con detalles densos, el verdadero Flash resumió y abandonó, mientras que este checkpoint siguió produciendo registros detallados y no repetitivos hasta alcanzar el límite de caracteres del navegador y bloquear la página. Esa resistencia coincide con un límite de salida de 256k tokens filtrado y atribuido a Gemini 4 Pro, lo que refuerza la suposición de que se trata del checkpoint insignia. El video también explica cómo probarlo —iniciar sesión en Arena, abrir el modo Battle y elegir Code— y subraya que incluso con el nivel de razonamiento más bajo de Arena, las salidas se ven sorprendentemente sólidas, lo que implica que la capacidad en el lanzamiento podría ser aún mayor.
Las salidas creativas del checkpoint forman el núcleo del informe. Un juego fluido estilo Mario Kart con generación de mundos, un coche de Fórmula 1 renderizado en 3D con iluminación y ángulos de cámara variados, un templo en voxel-art completo con hojas de cerezo cayendo, peces en el río y un ciclo completo de día y noche, y una PlayStation 5 en SVG puro: todo se presenta como inusualmente pulido para Arena. El ejemplo más comentado es un SVG animado de una Nintendo Switch donde los mandos encajan en el cuerpo y la pantalla arranca con el logo; el presentador dice que Gemini 4 Pro superó claramente a Opus 5 en ese prompt. Una generación SVG de diez minutos que muestra profundidad, múltiples puntos de vista, el brillo del botón de silencio e incluso una capa de esqueleto, más un prompt lado a lado de un pelícano en bicicleta donde GPT-6 Astra sigue liderando en profundidad visual, juntos demuestran que el nivel de razonamiento base del checkpoint fantasma ya es competitivo con los mejores modelos —alimentando la narrativa del regreso de Google mientras deja abierta la verificación independiente.
GPT-6 Soul: corte, niveles y primeras impresiones
Por el lado de OpenAI, el informe presenta GPT-6 Soul como un nivel de eficiencia a corto plazo antes de la Dev Day. Su corte de conocimiento se describe como el 30 de abril, la misma fecha atribuida a GPT-6 Astra, lo que sugiere un linaje compartido, con niveles inferiores posiblemente llamados Luna y Terra. Se dice que Soul entró en pruebas grises dentro de la aplicación web de ChatGPT, donde los primeros probadores reportan un formato más rico y una memoria y personalización notablemente mejores. Un SVG de mando de PS5 generado con alto esfuerzo de razonamiento en unos tres minutos y un interior de casa en 3D codificado en un entorno similar a 3GS se ofrecen como señales de que incluso el nivel más barato se acerca a la calidad de Astra. El presentador también transmite afirmaciones de que Soul venció al Claude Opus 5.2 aún no lanzado en un par de prompts usando menos tokens —pero advierte que son impresiones tempranas no verificadas, no benchmarks, y que el precio frente a Astra y la velocidad real solo quedarán claros en el lanzamiento.
Grok 4.7 aparece en las cuotas de la nube
Para Grok, la señal es su aparición dentro de las cuotas y límites del sistema de Google Cloud. Combinado con el anterior «coming soon» de Elon, el listado se interpreta como un lanzamiento a días vista, aunque la ventana original de diez días ya se ha retrasado. Las primeras cifras citadas en el video sitúan a Grok 4.7 en 6,4 en Colony Bench Mega, un salto claro sobre Gemini 3.8 Flash con 2,7 y GPT-5.6 Soul con 2,6, pero todavía muy por detrás de GLM 5.3, DeepSeek 4.1 Flash, GPT-6 Astra Pro y Claude Fable 5. En el lado de CUDA el panorama es más ajustado: 9,5 en la prueba fusionada de GLM 5.2, apenas por encima del 9,4 de Grok 4.6, con pequeñas ganancias en otras cargas de trabajo CUDA. La lectura del presentador es equilibrada —un paso real sobre 4.6, pero a menudo marginal— y sugiere esperar reruns independientes antes de extrapolar.
Union Alpha desenmascarado: Pareto 269 y la verdad del harness
El mayor misterio de la semana, Union Alpha, se resolvió justo después del montaje principal. Presentado inicialmente como un modelo sigiloso disponible gratis vía OpenCode, OpenRouter y Klein, con una ventana de contexto de 256k, soporte multimodal y enfoque en codificación agéntica, se le atribuía un rendimiento cercano a Astra y a Opus 5 por aproximadamente una dieciochoava parte del costo esperado. La revelación posterior lo identifica como Pareto 269 de Unbiased —no un solo modelo sino un sistema que enruta el trabajo entre varios modelos abiertos y de frontera, al estilo del anterior montaje Sukuna. Los precios listados son 2,50 $ por millón de tokens de entrada y 0,25 $ para entrada en caché, 7,50 $ por salida, supuestamente menos de un cuarto del precio de lista de Astra. Ese enrutamiento explica por qué parecía tan cercano a los modelos de frontera en algunas tareas: el harness reenvía el trabajo a esos modelos cuando es necesario. Mi lectura es que Union Alpha debe juzgarse como un producto de orquestación en lugar de un peso; la pregunta crítica es cuán transparente es la lógica de enrutamiento, no solo el precio de portada.
Jev de Typesafe, desarrollado con Dio, se sitúa en un eje completamente distinto. A diferencia de los grandes modelos de lenguaje clásicos que generan texto token a token, Jev toma una entrada no estructurada y un conjunto predefinido de salidas posibles y devuelve decisiones estructuradas con probabilidades, calculando todo en paralelo. Su enfoque de entrenamiento se llama RLCD, aprendizaje por refuerzo para decisiones calibradas. Los benchmarks de la propia empresa afirman una rapidez de 20 a 200 veces mayor con un costo de 40 a 400 veces menor en los flujos de decisión que probaron, con precios de cuatro centavos por millón de tokens de entrada y salidas gratis —afirmaciones que necesitarán validación independiente. La limitación clave es explícita: Jev no genera texto normal, por lo que no es un reemplazo de GPT-6 Astra ni de ningún modelo Claude; en cambio, se posiciona como un compañero que maneja miles de decisiones baratas y rápidas alrededor de un modelo de frontera —enrutamiento, clasificación, evaluación de salidas o elección de la siguiente acción de un agente.
Dream RSI, Claude Projects y la carrera de RL pública de Xiaomi
Dream RSI de Google DeepMind se presenta como un bucle que está cerca de cerrarse, pero que aún no lo está. Los pesos del modelo no mejoran directamente; el agente que explora la política aprende de su propio historial de intentos de descubrimiento y mejora en la búsqueda de soluciones con el tiempo. El video dice que el bucle se demostró en algoritmos, ingeniería de kernels de GPU y desarrollo de modelos, lo que sugiere que la mejora de la política se generaliza más allá de una sola tarea. La advertencia importa: se trata de una mejora recursiva de la política de búsqueda, no de una auto-mejora recursiva de los pesos, así que aunque la etiqueta RSI es emocionante, el resultado es un paso controlado hacia ella en lugar de una evolución autónoma completa a nivel de pesos.
Los nuevos Projects de Claude dentro de Claude Code se presentan como una mejora práctica para el trabajo en movimiento: dale a Claude varias tareas en una conversación y las distribuye en hilos paralelos que siguen ejecutándose después de cerrar tu portátil, con memoria y archivos compartidos sincronizados entre hilos. Actualmente está en beta limitada para suscriptores Pro y Max, con un despliegue más amplio previsto —potencialmente junto con Opus 5.2. El Mimo 2.6 de Xiaomi, tras casi seis meses de silencio, se describe como a mitad de una enorme carrera de aprendizaje por refuerzo que escala el cómputo de RL, los entornos agénticos multitarea y el cómputo general, generando aproximadamente dos mil millones de tokens por paso de entrenamiento a través de miles de rollouts paralelos. Se dice que el equipo está transmitiendo la carrera públicamente y que abrirá más detalles de entrenamiento en las próximas semanas, aunque el modelo en sí aún está a uno o dos meses.
El informe cierra con una breve demo de robot donde GPT-6 Astra impulsa pasos de baile, un recordatorio simbólico de que los grandes modelos ahora abarcan desde la artesanía SVG hasta la coreografía física. Tomado en conjunto con las promociones del presentador de su newsletter, su benchmark y su plataforma de vibe-coding, el panorama es claro: Google está auditionando discretamente un regreso vía Arena, OpenAI está apilando una familia para reducir costos, xAI está calentando un lanzamiento mediante cuotas de nube, y Xiaomi está ganando confianza al abrir el registro de entrenamiento. Mi lección de la semana es leerla no como un solo ganador sino como estrategias de transparencia en competencia —qué prueba fantasma es más honesta, qué cuota se filtró primero, qué registro enseña más— ahí es donde se está jugando la verdadera contienda.
Momentos clave
- Apertura — ocho titulares en un solo informe
- Prueba fantasma de Gemini 4 Pro y la afirmación de 256k
- Generaciones 3D de Mario Kart y Fórmula 1
- Templo en voxel con detalle de ciclo día/noche
- PS5 en SVG puro — diez minutos de profundidad
- Pelícano en bicicleta — lado a lado con Astra
- Corte de GPT-6 Soul y rastros de pruebas grises
- Cuota de Cloud de Grok 4.7 y primeras puntuaciones
- Union Alpha y la revelación de Pareto 269
- Jev, Dream RSI, Claude Projects y Mimo 2.6
Comentario de la IA
"«Lo que me llamó la atención esta semana no fue un solo modelo, sino cómo nos enteramos de ellos: las ejecuciones fantasma en Arena, las fugas de cuotas en Google Cloud y los registros públicos de RL convirtieron la propia infraestructura de pruebas en el titular, en lugar de cualquier fecha de lanzamiento.»"
Evaluación de la IA
El mejor argumento en contra de este informe es moderar la calidad de las filtraciones. Las pruebas fantasma en Arena se ejecutan a un nivel de razonamiento más bajo y uno llega a un checkpoint por azar; el SVG o el 3D pulido que vemos puede ser un mejor caso seleccionado, no el promedio. Números como un límite de salida de 256k provienen de etiquetas, no de mediciones independientes. Deducir un regreso completo de Google a partir de una sola animación de Switch es por tanto exagerado; lo que importa es la repetibilidad entre ejecuciones y la tasa de fallos, no el video de highlights.
La segunda carencia es de método y límites de tiempo. La prueba JSON de mil planetas muestra resistencia, pero sin métricas de diversidad, coherencia y verdadera no repetición también podría ser una demostración de memorización. El SVG de esqueleto de la PS5 es impresionante, pero tomó diez minutos y bloqueó un navegador al alcanzar el límite de caracteres —costos que pueden no ser aceptables en uso real y que plantean preguntas prácticas de latencia y estabilidad. Las puntuaciones de Colony Bench y CUDA de Grok 4.7 son igualmente tempranas y estrechas; el panorama podría cambiar en otros dominios, contexto largo o pruebas de seguridad. El paso prudente es tratarlas como señales, no veredictos, hasta que aparezcan reruns independientes.
En cuanto a motivos y verificabilidad, cada titular conlleva gestión de expectativas: los rastros de Gemini se basan en comparticiones anónimas de usuarios, GPT-6 Soul en observaciones de pruebas grises, Grok en un listado de Cloud, y Union Alpha en un harness comercializado al principio como un modelo gratuito. Los precios de Pareto 269 suenan muy atractivos, pero si parte del trabajo se enruta a modelos de frontera, el precio que pagas y el costo del modelo que realmente hizo el trabajo no son lo mismo; sin un registro de enrutamiento transparente, las comparaciones de costos engañan. La afirmación de Jev de una ganancia de velocidad de 20 a 200 veces y una reducción de costo de 40 a 400 veces también se midió en los propios flujos de la empresa y necesita benchmarking independiente antes de generalizar.
Mi consejo práctico es convertir tres hábitos en rutina ahora mismo: sondear el checkpoint fantasma en Arena con el mismo prompt varias veces, vigilar las cuotas de Cloud para Grok, y leer los registros públicos de RL de Xiaomi. Pero no apuestes por la muestra más brillante de un solo video a la hora de decidir. Si estás prototipando, prueba el fantasma de Gemini con el mismo prompt SVG repetidamente, mide las ganancias de memoria y formato de Soul con tus propios datos, espera el lanzamiento oficial de Grok 4.7, presupuesta Union Alpha como orquestación en lugar de un peso, y pilota Jev solo como capa de decisión sabiendo que no puede generar texto.
Fuentes
11 enlaces; 3 de ellos también citados por 19 otras noticias. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
- @youtube https://www.youtube.com/watch?v=ZJ6RUAH--Js
- @officechai https://officechai.com/ai/gemini-4-0-pro-arena/
También citado por: The costume on Arena: Gemini 4 traces leaking under the Gemini 3.8 Flash label
- @finance https://finance.biggo.com/news/66df2f89-c067-43d7-b888-94deb071f472
- @openai https://openai.com/index/gpt-6-astra/
También citado por: Brain and Body: A Single-Screen Agent Setup with GPT-6 Astra on Hermes · Space Bunny Alpha: Inside OpenRouter's Free Anonymous AI Experiment · Robot-Use Agents: Why General-Purpose Models May Win Robot Control · Building a Productive Card Collection App in Minutes with Base44 and GPT-6 Astra · Price War Begins: GPT-6 Sol and Luna Halve Model Costs · Gemini 4 Leak? 10 Interactive 3D Tests Against GPT-6 Astra and Fable 5.1 · 10,000 Agents, 88 Hours, $1 Million: AI Mastermind #39 From Code to Cash to Autonomy · Cloning a Channel With One Prompt: The $33K Video Factory Built on GPT-6 Astra and Higgsfield · GPT-6 Astra Guide: How Horizontal Power Turns the Model Into Work Done · From Hand Sketch to Realistic Villa: A Showcase Video with GPT-6 Astra and Higgsfield MCP · The $500-a-Day Claim With GPT-6 Astra: Building Three Business Models End to End · When Agents Take the Job: Investing in the Stack After GPT-6 Astra (+5)
- @ccleaks https://ccleaks.com/news/openai-gpt-6-astra-launch-sep-2026
- @digg https://digg.com/ai/wityfrzg
- @gigazine https://gigazine.net/gsc_news/en/20260918-union-alpha/
- @theregister https://www.theregister.com/ai-and-ml/2026/09/16/typesafe-ai-debuts-model-for-machines-that-plays-doom/
- @aimodeling https://www.aimodeling.com/en/news/slug/dream-rsi-replay-simulator
También citado por: Did Google Just Dream Its Way to Self-Improvement? Inside Dream RSI and the Intelligence Explosion Debate
- @forkast https://forkast.news/xiaomi-mimo-v2-6-breaks-cover-a-1t-class-chinese-lab-trains-in-public/
- @digitaltoday https://www.digitaltoday.co.kr/en/view/103667/musk-admits-grok47-not-better-than-rivals-teases-agi-with-grok5
gemini 4 pro · gpt-6 soul · grok 4.7 · union alpha · pareto 269 · dream rsi · mimo 2.6