Durante el fin de semana, un modelo listado como Gemini 3.8 Flash en Arena llamó la atención porque no se comportaba en nada como la versión pública que Google lanzó el 2 de septiembre. El conocido 3.8 Flash es un nivel de velocidad con geometría aproximada, mientras que esta entrada anónima guardó silencio durante unos 10 minutos ante una solicitud cruda de un SVG de PlayStation 5 y luego soltó miles de líneas que capturaban curvas, sombras e incluso el pequeño detalle de la unidad óptica de una sola vez. Dado que el Flash oficial responde a la misma solicitud en 10 a 15 segundos con formas toscas, los observadores enmarcaron la elección como el Flash más lento de la historia o un disfraz arrojado sobre algo más grande.
Cómo se detectó la prueba disfrazada en Arena
Arena nació en 2023 de un equipo de UC Berkeley como una prueba a ciegas donde dos modelos responden lado a lado sin marca y los usuarios votan, dando a los laboratorios una señal limpia libre de efectos halo, y estas ejecuciones anónimas son rutinarias, con Google circulando a menudo puntos de control de Gemini de esa manera. Un modelo anónimo de mediados de agosto llamado Ox Alpha irrumpió en el top tres en 48 horas y sigue sin reclamar hasta hoy. Lo que destacó aquí no fue el anonimato sino la reutilización del nombre de un modelo ya lanzado, lo que se lee menos como sigilo y más como camuflaje.
Por qué la fidelidad visual se lee como un salto
El trabajo preciso con coordenadas espaciales en código vectorial es un punto de fallo notorio donde la mayoría de los modelos devuelven formas aproximadamente alineadas, rutas rotas y geometría simplificada, así que las comparaciones lado a lado filtradas tuvieron peso. Pagodas de vóxeles, renders de BMW M4 y el clásico pelícano montando una bicicleta bajo un cielo crepuscular lleno de estrellas llegaron sin recortes ni formas desalineadas, mientras que una variante manejó la gradación de día a noche, faros funcionales, etiquetas anatómicas del ave y control de cadencia en un solo prompt. El desarrollador Pankaj Kumar señaló que el modelo analiza instrucciones largas de varias partes en una sola pasada sin cuatro rondas de supervisión, y la demostración de 14 minutos con temática de boceto del desarrollador B, donde el desplazamiento oscurece las líneas como concepto, encarnó el mismo salto.
La larga pausa no se describe como lucha sino como cómputo pesado en tiempo de prueba. El enfoque Flash anterior entrega formas básicas y matemáticas de coordenadas aproximadas al instante, mientras que este planifica, escribe, ejecuta, depura y pule internamente antes de transmitir nada. Esa brecha refleja una filosofía de diseño diferente para la colocación de precisión y las matemáticas avanzadas de vóxeles e iluminación, poco probable que se envíe por accidente bajo una etiqueta de velocidad.
Webs y juegos de una sola pasada
La cola creativa siguió creciendo. Un héroe cyberpunk con toques retrofuturistas superponía una cuadrícula dimensional con un panel de métricas en tiempo real y un objeto 3D en la cabecera sin colapso visual. Un Airbus H145 en unos 10 minutos, una pagoda de píxeles que se siente presente y una simulación de vuelo claramente por delante del 3.8 Flash oficial se entregaron cada uno en una sola pasada. En conjunto, compartir un nombre mientras se da vueltas alrededor de la versión oficial argumenta que no son el mismo modelo.
Los juegos empujaron la escala más lejos. Una construcción estilo Minecraft cuya finalización, de la arquitectura de la página a los módulos individuales, se sitúa a la par de los resultados publicados de Astra, y un juego de carreras de karts en 3D que se dice más moderno que KartRider en su apogeo, ambos surgieron con lógica interactiva completa en una ventana corta. Una simple prueba de gato SVG señalada por el desarrollador Vidi, donde un modelo frontera competidor devolvió una forma parecida a un tigre, subrayó el punto de fidelidad espacial más que una broma.
Puntuaciones filtradas y el golpe de precios
La pieza viral es la tabla filtrada, tomada explícitamente con pinzas porque nada está confirmado. Afirma aproximadamente un 88 por ciento en Deep SWE 1.1 para codificación agéntica, unos dos puntos por delante de Astra, el único 2064 Elo en GDP Eval-A-V2 para trabajo de conocimiento del mundo real, 95,3 por ciento y primer puesto en Terminal Bench 2.1 para codificación en terminal, y 86,8 por ciento en OSWorld 2.0 para uso de computadora, por delante tanto de Astra como de Fable 5.1. Si es exacto, el barrido a través de codificación, agentes, razonamiento y operación sería amplio.
El rumor de precios puede morder más fuerte. El comentario habla de 2,25 dólares por millón de tokens de entrada y 11,25 por millón de salida, lo que frente a Astra lanzado el 3 de septiembre y Fable 5.1 el 1 de septiembre a 10 y 50 dólares sería exactamente el 22,5 por ciento del nivel frontera. Frente al precio promocional de 0,75 y 3,75 dólares del propio Gemini 3.8 Flash de Google hasta diciembre de 2026, es aproximadamente el triple, encajando con la expectativa de un nivel pro y apoyando discretamente el argumento del no-Flash. Hasta que Google publique tarifas, esto sigue siendo especulación.
Tras bambalinas, un año difícil y rastros de RSI
La historia de bambalinas proviene de llamadas con enrutamiento fantasma. Rastreadores incluido Qwena informan de un techo de entrada de 10 millones de tokens y un techo de salida de 256.000 tokens frente a los 1.048.576 y 65.536 oficiales, unas 9,5 veces de entrada y casi cuatro veces de salida, lo que junto al límite típico de generación de 4K a 16K permitiría repositorios enteros o novelas largas en una sola pasada continua. Las afirmaciones añadidas incluyen memoria nativa entre sesiones que persiste entre hilos sin un almacén vectorial añadido, acceso directo a internet sin API, trampas de sandbox que enrutan automáticamente el código no confiable a entornos sintéticos aislados, y traducción nativa de control motor robótico apuntando hacia modelos multimodales unificados destinados a ejecutarse en hardware físico. Todo sigue sin verificar y, a mediados de septiembre, Google no ha publicado ninguna ficha de modelo, recuento de parámetros ni endpoint para Gemini 4 o 4 Pro.
El contexto hace legible la especulación porque Google ha tenido un año difícil en la cima. La última actualización pro real fue Gemini 3.1 Pro el 19 de febrero, hace unos siete meses, la vista previa de Gemini 3.5 Pro presentada en el I/O para junio se retrasó repetidamente y en agosto informes de Semi Analysis y The Wall Street Journal dijeron que fue eliminada porque el modelo pro no mejoraba más rápido que Flash y la arquitectura fue desechada. La línea confirmada llegó en cambio el 21 de julio cuando la publicación de Google anunciando Gemini 3.6 Flash dijo que su esfuerzo de preentrenamiento más ambicioso hasta la fecha había comenzado para Gemini 4, eco recogido dos días después por Pichai en la llamada del Q2 de Alphabet de que Google necesita Gemini 4 para seguir siendo competitivo en la frontera mientras las evaluaciones de preentrenamiento se veían fuertes y el postentrenamiento avanza.
Eso lleva al susurro que persigue al año: RSI, o mejora recursiva de sí mismo. Jasjit Singh, director de estrategia de DeepMind, en la Agentech AI Summit de Berkeley, dijo que RSI se ha convertido en el núcleo de la tesis de gasto de capital de la industria mientras admitía que los ingresos actuales de la IA no sostienen un gasto a esta escala, con la apuesta de que la curva de capacidades sigue subiendo más allá de lo exponencial. The Information sitúa un RSI realista alrededor de 2027 a 2028, mientras que el rumor afirma que Gemini 4 terminó el preentrenamiento antes de tiempo porque DeepMind cerró un bucle de RSI durante el entrenamiento. Una investigación publicada el 14 de septiembre llamada Dream RSI sobre agentes que mejoran continuamente sus estrategias de búsqueda durante la exploración y arrastran la experiencia hacia adelante no prueba la afirmación pero confirma que RSI está en el centro de la hoja de ruta. Los intereses son enormes con Alphabet en torno a 4,23 billones de dólares tras cruzar los 4 billones en enero por el anuncio de Apple de Gemini para la nueva Siri, TPUs fabricados por TSMC y servidores de Foxconn, Quanta, Inventec, Wistron y Wiwynn que vinculan la escala de entrenamiento a los libros de pedidos taiwaneses, más Gemini Sparks en Japón desde julio y una incorporación empresarial constante a Gemini Enterprise. Google no ha confirmado nada sobre Arena, pero su patrón de pruebas de estrés públicas semanas antes de los anuncios alimenta la conjetura de consenso de una revelación de otoño junto con herramientas para desarrolladores, muy probablemente en octubre, así que vigilar ese espacio de Arena puede señalar que el disfraz se cae antes de cualquier comunicado de prensa.
Momentos clave
- Apertura — la idea del disfraz y el SVG de 10 minutos
- Qué es Arena — la prueba a ciegas de UC Berkeley
- PS5 y vóxeles — curvas, sombras y alineación
- Pelícano en bicicleta — examen de razonamiento espacial
- Política de cómputo — cómputo pesado en tiempo de prueba
- Demostración y Airbus — sitio de bocetos de 14 minutos, helicóptero de 10 minutos
- Puntuaciones y precios — tabla filtrada y afirmación del 22,5 por ciento
- Bambalinas y RSI — ventana de 10M, Dream RSI del 14 de septiembre
Comentario de la IA
""En mi opinión, esta filtración revela más una postura de pruebas que un modelo: un modelo con etiqueta de velocidad ejecutándose deliberadamente lento se lee como una señal sobre la política de cómputo y el calendario de lanzamiento, más que sobre estética pura.""
Evaluación de la IA
La parte más fuerte de esta filtración es el emparejamiento de una etiqueta de velocidad con una generación lenta deliberada que entrega precisión quirúrgica de coordenadas y análisis en una sola pasada de prompts largos de varias partes, como describen los desarrolladores; si ese cómputo pesado en tiempo de prueba se dedica realmente a planificar y depurar internamente, la brecha filosófica entre dos modelos que comparten una etiqueta se vuelve legible y apunta a un nivel pro.
Sus límites son que toda la cadena sigue sin verificar. La tabla, los techos de 10 millones de entrada y 256 mil de salida, la memoria persistente y el control motor carecen todos de una ficha de modelo o endpoint de Google, las capturas de pantalla y los rastros de rutas fantasma arriesgan un uso selectivo, y quedan preguntas sobre cómo generaciones de 8 a 10 minutos encajan en las expectativas de un producto en vivo, cómo serán los precios tras la ventana promocional de diciembre, y cómo se gobernaría a escala el sandbox para código no confiable.
La conclusión es que el video enmarca correctamente el año difícil: la brecha desde febrero, la cancelación reportada de la 3.5 tras no superar a Flash, y el cambio al preentrenamiento de Gemini 4 desde julio están confirmados, mientras que la afirmación de que un bucle de RSI se cerró antes de tiempo y el artículo Dream RSI que muestra la evolución de estrategias de búsqueda son señales adyacentes que no deben confundirse en causalidad y que juntas crean tanto oportunidad como fragilidad si el rendimiento y el costo mejoran a la vez.
En la práctica, revisar ese espacio de Arena semana a semana, volver a ejecutar los prompts del gato SVG y del pelícano en tus propias pruebas, y tratar los precios filtrados como especulación hasta la ventana de octubre y la expiración de la promoción de diciembre es la postura más sana; en lugar de fijar un plan de producción antes de que llegue una ficha de modelo, observa si las escrituras de repositorios en una sola pasada y la continuidad de 256 mil tokens se mantienen estables y reproducibles.
Fuentes
7 enlaces; 4 de ellos también citados por 6 otras noticias. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
- @youtube https://www.youtube.com/watch?v=Pic4NLTjx6w
- @blog https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/
También citado por: Gemini Managed Agents 09-2026 Leap: Anti-Gravity on Gemini 3.8 Flash Finally Works Like a Real Teammate · DeepSeek V4.1 Flash Meets Gemini 3.8 Flash: A Five-Prompt Coding Duel
- @arxiv https://arxiv.org/abs/2609.14858
También citado por: Did Google Just Dream Its Way to Self-Improvement? Inside Dream RSI and the Intelligence Explosion Debate · Google's Dream RSI: Turning History into a Simulator for Recursive Self-Improvement
- @officechai https://officechai.com/ai/gemini-4-0-pro-arena/
También citado por: Gemini 4 Pro Leaks, GPT-6 Soul in Testing: From Arena to Google Cloud, the Week's AI Shockwave
- @nokiapoweruser https://nokiapoweruser.com/gemini-4-pro-arena-ai-test-specs-leaks/
También citado por: Gemini 4 Leak? 10 Interactive 3D Tests Against GPT-6 Astra and Fable 5.1
- @blog https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-6-flash-3-5-flash-lite-3-5-flash-cyber/
- @searchenginejournal https://www.searchenginejournal.com/pichai-says-google-needs-gemini-4-to-compete-at-the-frontier/583214/
gemini 4 · gemini 3.8 flash · arena · google deepmind · rsi · dream rsi · nodesdaily