Volver al inicio

1 Millón de Tokens en Una Respuesta: Por Qué los Trabajos Largos Rompen el Límite

Un análisis del canal NetworkCoder examina un modelo experimental de Google que escribiría 1 millón de tokens en una respuesta, y explica por qué las migraciones largas y los trabajos de agentes se rompen en los límites de salida.

Importado a Nodesdaily: (UTC+03:00)
Ver en YouTube — xoT4nuJcQoM
Opciones de lectura

La voz del dispositivo no está disponible en este navegador.

Lupa de conceptos

Elige un término técnico de esta vista para leer su definición general, un ejemplo didáctico y su uso en el artículo.

No se encontró ningún término de nuestro glosario en esta vista. El glosario aún no cubre todos los términos.

Los trabajos grandes no suelen romperse porque el modelo no sepa, sino porque la respuesta se corta por la mitad. El presentador parte de una frustración conocida: los modelos Flash rápidos y baratos sostienen el día a día, pero las tareas duras sufren por un contexto frágil y una continuidad rota. La afirmación es audaz: un modelo experimental de Google llamado Argon escribiría 1 millón de tokens en una sola respuesta, unas ocho veces los límites actuales. Trato esa cifra como afirmación del presentador y separo sus dichos de los datos independientes.

Primero el contexto. El narrador cuenta que Google solo publicó variantes Flash tras la Gemini 3.1 Pro de primavera, dejando a los desarrolladores a la espera de un buque insignia capaz de medirse con Claude y GPT en tareas duras. Una parte se verifica en fichas públicas: la ficha de Artificial Analysis (artificialanalysis.ai) otorga 30 puntos a la Gemini 3.1 Pro Preview en el índice de inteligencia con una ventana de contexto de un millón de tokens. La puntuación de 53 y el salto de 23 puntos atribuidos a Argon solo existen en el video, sin entrada de Argon en tablas independientes. El despliegue por etapas pide la misma cautela: primero socios de ciberseguridad y probadores de confianza, luego API de pago y suscriptores Ultra. Estas aperturas graduales resultan familiares, porque las ejecuciones muy largas exigen cómputo pesado.

Por qué el límite de salida fragmenta el trabajo de los agentes

Límite de salida y ventana de contexto suelen confundirse, pero difieren. La ventana dice lo que el modelo puede leer; el límite dice lo que puede escribir en una respuesta. El presentador sitúa los modelos Google anteriores cerca de 64 000 y el lado de Opus y GPT-6 Astra cerca de 128 000. Existe un ancla independiente: la guía de ClaudeLab (claudelab.net) documenta paso a paso el soporte de 128 000 de salida en Opus 4.6 y Sonnet 4.6. Así que 128 000 es una referencia real del sector, mientras que un millón sigue siendo por ahora una afirmación propia de Argon. Como los modelos usan generación autorregresiva , escribiendo cada tramo nuevo a la vista de todo lo anterior, un agente que toca el techo debe resumir y reiniciar en una respuesta nueva.

Ese reinicio no es un inocente botón de continuar. El agente se detiene, comprime el avance logrado y abre una respuesta fresca; en cada traspaso, nombres de variables, decisiones previas y casos borde raros se vuelven más tenues. El anfitrión cita tres beneficiarios concretos: las migraciones de código que aplican el mismo cambio cuidadoso a cientos de archivos, suites completas de pruebas escritas con coherencia en todo un repositorio, e informes de investigación profunda que leen, razonan y redactan documentos largos sin atascarse. El dolor suena real para los equipos. El ejemplo estrella queda en nivel de afirmación: un decodificador de video real se habría reescrito desde unas 32 000 líneas de código de bajo nivel para correr 2,7 veces más rápido, sin informe reproducible adjunto.

El precio de ingeniería: acumulación de errores y memoria

Dos barreras explican por qué no todos los laboratorios sirven salidas enormes. Primero la acumulación de errores : incluso pasos casi perfectos se combinan mal en cadenas largas, algo que el presentador ilustra con un cálculo simple de probabilidad en torno al 99 por ciento de fiabilidad por paso. Segundo la memoria: cada tramo escrito debe recordarse mientras se produce el siguiente, así que respuestas más largas exigen más memoria por paso. La investigación lo toma en serio: trabajos en arXiv (arxiv.org) miden cómo pequeñas desviaciones de la caché clave-valor degradan la calidad en generaciones largas. Para el marco oficial, la ficha de DeepMind (deepmind.google) de Gemini 3.1 Pro lista capacidades, limitaciones y evaluaciones de seguridad, una buena lente para leer promesas de contexto largo.

La solución descrita en el video suena plausible: una respuesta larguísima se pausa y se retoma en llamadas siguientes, de modo que nada caduca a mitad de camino. El anfitrión habla de continuación de decodificación larga. A unos 100 tokens por segundo, un millón completo tomaría casi tres horas de escritura, así que el diseño apunta a faenas largas y cuidadosas más que a arreglos rápidos. La expectativa importa aquí: escribir más largo no significa terminar más rápido, sino terminar con menos fracturas. En velocidad, el dato independiente vuelve a llegar desde la ficha de Artificial Analysis: la Gemini 3.1 Pro Preview corre a 115 tokens por segundo, entre los modelos rápidos, así que la infraestructura parece lista para la carrera larga.

Tabla de puntuaciones: qué mide cada prueba

Esta es la sección que exige la lectura más atenta, porque no todos los números comparten escala. Según el presentador, Argon lidera una prueba real de ingeniería de software con 77,9 frente a rivales cerca de 74, queda primero en un banco de automatización y domina la clasificación Arena textual votada por humanos, aunque va detrás de Opus en Frontier SWE y en pruebas de codificación en terminal. La alfabetización en bancos resulta esencial para interpretar la brecha: la guía de Dreaming Press (dreaming.press) subraya que una puntuación de código es puntuación de modelo más arnés, con el mismo modelo dando resultados muy distintos según el montaje del agente. La investigación en arXiv (arxiv.org) sobre el efecto del arnés respalda la advertencia y trata la elección del montaje como variable oculta. Del lado de preferencia humana, la tabla textual de LMArena (lmarena.ai) ofrece una tabla viva construida con millones de votos, y cualquier primer puesto autoproclamado debe leerse frente a esa distribución.

Según la cobertura metodológica recogida vía artificialanalysis.ai, las cifras de alucinación y exactitud exigen la misma separación prudente, y el tramo más entusiasta del video también es el más fácil de malinterpretar. La afirmación: Argon mostraría alrededor del 15 por ciento de alucinación frente a un 51 por ciento aproximado de la rival Astra, entre los más bajos medidos a este nivel. Pero la exactitud en la misma prueba se invierte, 50 para Argon contra 63 para Astra. Dicho de otro modo, el modelo lidera no por saber más hechos, sino por callar cuando ignora. En práctica de ingeniería esa distinción vale dinero real, porque una API inventada o una librería inexistente puede quemar horas. Estas tasas siguen siendo mediciones recogidas por el video; ninguna tabla independiente lista a Argon, así que las llevo como afirmaciones del presentador.

Precio, caché y preparación antes de probar

La tarifa parece agresiva a primera vista: 2 dólares por millón de tokens de entrada, 10 dólares de salida, con la entrada en caché un 95 por ciento más barata. La estructura coincide con fichas reales: la ficha de Artificial Analysis (artificialanalysis.ai) lista el mismo precio de entrada de 2 dólares y un descuento de caché del 90 por ciento para la Gemini 3.1 Pro Preview. El mecanismo mismo está documentado: la documentación de Claude (platform.claude.com) explica cómo se configura la caché para cargas de contexto largo y por qué se exigen coincidencias exactas. El anfitrión añade que el precio de lanzamiento es introductorio y que el costo por tarea importa más que el precio por token; los apetitos citados de unos 62 000 frente a 27 000 tokens por tarea siguen siendo cifras solo del video. Sus cuatro pasos de preparación son sensatos: elegir una tarea larga donde el modelo actual sufra, activar la caché, topar la clave API, y seguir duración y tokens por tarea. Añado un quinto: correr la misma tarea lado a lado con el modelo actual y dejar que la medición, no los eslóganes, decida.

Visualization: nodesdaily AI
TemaResumen
Afirmación1 millón de tokens por respuesta, sin prueba
InterésFaenas agentes largas sin fragmentar
Regla de costoCaché y medición por tarea exigidas

Momentos clave

  1. Siete meses sin insignia, llega Argon
  2. El punto: terminar sin fragmentar
  3. 1 millón y afirmación del 8x
  4. Escritura autorregresiva y pérdida
  5. Ejemplos de migración y pruebas
  6. Decodificador y 2,7x afirmados
  7. Puntajes: Deep Suite y Arena
  8. Alucinación frente a exactitud
  9. Precios, caché y preparación

Comentario de la IA

"Lo que valoro del video es el encuadre más que las cifras: el asunto no es responder más largo sino terminar el mismo trabajo en una sola pasada coherente. Tomo la cifra del millón con cautela sin verificación independiente, y me tomo en serio la discusión de memoria y costo."

Evaluación de la IA

Empiezo con la objeción más fuerte: 1 millón de tokens impresiona, pero para la mayoría de los equipos el cuello real sigue siendo la latencia y la factura, no la longitud de escritura. Una respuesta única de tres horas mata la iteración rápida; en el día a día, un modelo pequeño veloz y preciso suele ganar en la práctica a un gigante lento. El anfitrión lo concede: el lado Opus lidera en pruebas de terminal. Este modelo apunta pues no a cada tarea, sino a las pocas faenas largas que no toleran fragmentarse.

La lista de faltantes no es corta. No hay registro independiente de Argon: ni las tablas de Artificial Analysis, ni la ficha de DeepMind, ni la clasificación de LMArena muestran tal versión. El fin del descuento introductorio, la duración del acceso gradual, las necesidades de memoria y cómputo, y la medición reproducible de la historia del decodificador quedan sin respuesta. La alfabetización en bancos vale en ambos sentidos: cada primer puesto favorable a Argon también es puntuación de montaje más modelo y merece la misma cautela que los rivales.

Del lado de los incentivos del presentador, el cuadro parece bastante limpio: un canal de pruebas prácticas promete ensayos a fondo a cambio de suscriptores y vistas, sin vínculo comercial directo visible. El riesgo sigue siendo el énfasis selectivo; los tramos entusiastas toman la luz mientras los detalles que enfrían como la subida de precios y los tiempos pasan rápido. El mensaje práctico es claro: con una migración larga o refactorización, espera y mide; si no, no hay prisa por cambiar el modelo actual. Mi decisión sigue esa línea: anotar la afirmación, guardar la lección de arquitectura hasta un registro independiente, y gastar tiempo antes que dinero.

Fuentes

8 enlaces; 1 de ellos también citados por 1 otra noticia. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

modelos ia · agentes codigo · contexto largo · benchmarks · cache · alucinacion

Seguir el tema

Antes de esta noticia

Un breve orden de lectura de noticias anteriores vinculadas a este evento por un editor.

Evidencia y fuentes

Revisa los pasajes permitidos, sus versiones y su origen.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…