DeepSeek sigue siendo descrito como un pequeño laboratorio chino, y el contraste sigue siendo marcado: sin presupuesto a escala de OpenAI, un equipo decenas de veces más pequeño, acceso limitado a los aceleradores Nvidia más nuevos y ningún campus de datos descomunal. Sin embargo, DeepSeek V4.1 Flash, presentado el 10 de septiembre de 2026 como el miembro más pequeño de una nueva familia de arquitecturas, se perfila como un contendiente de clase fronteriza. No hay que leer el .1 como un parche: su columna vertebral de mezcla de expertos de 552 mil millones de parámetros es más de 2,5 veces mayor que el modelo al que reemplaza y más grande que los sistemas V3 y R1 que pusieron a DeepSeek en el mapa. Lo inusual es que la escala no infló la factura de servicio. Los pesos abiertos con licencia MIT, las rutas de ejecución para vLLM y SGLang, y un informe técnico en Hugging Face llegaron junto con el lanzamiento, de modo que la afirmación no se limita a una demo cerrada.
Para hacer legible la afirmación de eficiencia, el video enmarca la inferencia en dos fases. Durante la fase de lectura, la instrucción y los documentos adjuntos se dividen en tokens que fluyen por las capas; cada capa emite dos conjuntos de números por token, claves y valores, que se guardan como caché KV. Durante la fase de escritura, el modelo emite su respuesta token a token, mirando hacia atrás en esa caché para elegir el siguiente token más probable sin recomputar toda la historia. La analogía es clara: un estudiante que ve semanas de clases y toma notas no reproduce las clases para responder una pregunta; consulta las notas. La caché es ese cuaderno, y su tamaño determina si el trabajo se siente ligero o engorroso.
Para una instrucción corta, el cuaderno se mantiene delgado y cabe cómodamente en la memoria de alto ancho de banda, la superficie rápida justo al lado de la GPU. Las cargas de trabajo de agentes rompen esa calma: ejecuciones autónomas largas, grandes paquetes de documentos y un contexto del tamaño de una base de código inflan la caché hasta que el escritorio se desborda. La memoria de alto ancho de banda es rápida pero pequeña y cara; cuando se llena, el excedente se derrama a los SSD fuera de la GPU. Allí hay más espacio, pero el viaje de ida y vuelta es largo. Buscar una nota en un archivador al final del pasillo lleva mucho más que echar un vistazo al escritorio. Cada predicción del siguiente token espera entonces a que los datos viajen por la placa base hasta la memoria de alto ancho de banda y al procesador, dejando el cómputo inactivo. El video nombra los dos males con claridad: uno es la dispersión del cómputo, el otro es la pérdida de velocidad causada por mover una pila de notas cada vez más grande.
En un transformador estándar, cada capa escribe sus propias notas y el volumen total de caché escala con el número de capas a medida que los tokens avanzan, se agregan y repiten. DeepSeek V4.1 Flash corta ese patrón. Su columna vertebral de 40 capas se divide en un codificador causal de 20 capas y un decodificador de 20 capas, un diseño inspirado en YOCO que se lee más como una reconstrucción del modelo base que como un ajuste incremental. El codificador asume la carga de lectura mientras el decodificador se aparta en gran medida de calcular su propia caché global. Por eso, la etiqueta .1 es más administrativa que técnica; la estructura subyacente se comporta como una nueva familia.
La mecánica es simple de enunciar y difícil de equilibrar. En la fase de lectura, la mitad decodificadora permanece en gran parte inactiva mientras el codificador hace la lectura pesada y construye la caché KV global. Cuando comienza la escritura, el decodificador no relee todo; toma prestada la caché global completa derivada del estado oculto final del codificador mediante proyecciones por capa. A primera vista, la mitad del cerebro se salta la lectura, lo que sugiere un riesgo de comprensión, y el video es explícito sobre esa disyuntiva. El equilibrio de ingeniería es no perder significado mientras se omite trabajo. El decodificador no es ciego; aún construye su propio contexto local, la ventana estrecha alrededor de la frase que se escribe, usando atención de ventana deslizante.
Separar el contexto global y local: la ventana y la analogía ejecutiva
El contexto global es el paquete completo que se le da al modelo, la instrucción completa más cada documento adjunto, similar a las notas de semanas de clases. El contexto local es la porción estrecha relevante para la siguiente palabra, la redacción inmediata bajo la pluma. El decodificador omite recomputar la pila global y en su lugar aplica atención de ventana deslizante que atiende solo a los tokens más recientes. El video traduce esto a una imagen organizacional: analistas junior leen miles de páginas, hacen los números y producen un resumen ejecutivo denso; los ejecutivos senior no releen las miles de páginas y se apoyan en ese resumen para orientarse, luego se ponen lentes de lectura para examinar la redacción exacta de la página que tienen delante antes de firmar. Esa división permite que aproximadamente la mitad del modelo evite la creación masiva de caché global, reduciendo casi a la mitad el cómputo necesario para la lectura. Sin embargo, la hinchazón de memoria permanece; la siguiente capa de optimización aborda eso directamente.
Los números más llamativos están en la sección de memoria. El KV global por token cae de unos 390 000 bytes en DeepSeek V1 a 890 bytes en V4.1 Flash, una reducción de aproximadamente 437 veces. La generación Flash anterior rondaba los 3 500 bytes, así que el nuevo lanzamiento es casi cuatro veces más liviano. El mecanismo detrás de esto es la Atención Sparse Comprimida 2, o CSA2. En una pila convencional, cada capa escribe sus propias notas desde cero; CSA2 introduce un intercambio extremo con tres modos asignados estáticamente. Una capa Full crea su KV principal y un indexador y selecciona nuevos índices Top-512. Una capa Reindex reutiliza el KV principal y las claves del indexador de la última capa Full, pero las vuelve a puntuar con su propia consulta para producir una nueva vista de indexación. Una capa Reuse reutiliza tanto el KV principal como los últimos índices y no crea casi nada nuevo. Piensa en un mismo cuaderno explorado a través de tres tablas de contenido diferentes: una cronológica, una temática, una organizada en torno a saltos tecnológicos. Las notas siguen siendo las mismas mientras las rutas de navegación se multiplican, y el almacenamiento total se desploma porque muchas capas evitan crear notas nuevas por completo.
Compartir no basta; un indexador sparse jerárquico reduce el espacio de búsqueda. La primera capa del decodificador actúa como guardián: escanea toda la caché global y arma un grupo de candidatos de aproximadamente 16 000 posiciones entre un millón de tokens, organizado en 2 048 bloques de 8. Las capas siguientes tienen prohibido buscar fuera de ese grupo. Eso suena arriesgado, como si estrechar el diafragma pudiera inducir vacíos o alucinaciones, y el video plantea esa preocupación directamente. La respuesta es que el entrenamiento está ajustado para que el grupo de candidatos se arme con alta precisión y las capas posteriores apenas noten el resto faltante. En concreto, 18 capas de codificador CSA2 funcionan en tres grupos de seis con una tasa de compresión de 2 en un patrón 1-Full más 5-Reuse, mientras que 20 capas de decodificador funcionan en cinco grupos de cuatro con la primera como Full más 3-Reuse y el resto como Reindex más 3-Reuse. Cada capa conserva su propia consulta principal y su KV de ventana deslizante, pero la carga global se comparte, y la factura lo refleja en aproximadamente un cuarto de la memoria de alto ancho de banda y un octavo del SSD.
Otra medida contraintuitiva es la eliminación de la memoria a corto plazo. La atención de ventana deslizante crea una memoria hiperlocal que, en conversaciones de múltiples turnos, se guarda en caché en el SSD turno tras turno y obstruye el almacenamiento. La respuesta de DeepSeek, llamada SWA Bounded Replay, es eliminar por completo esa memoria local al final de un turno y, cuando sea necesario, recomputar solo los últimos 128 tokens desde cero en el acto. Suena derrochador después de un argumento de todo un video para ahorrar cómputo, y la narración se apoya en esa tensión. La disyuntiva se resuelve con las matemáticas de latencia. Persistir la memoria a corto plazo significa empujar bytes desde la GPU a través de la placa base hacia un SSD y luego traerlos de vuelta, un movimiento físico largo repetido muchas veces. Recomputar 128 tokens en una GPU moderna es una ráfaga aritmética a escala de microsegundos que casi no cuesta tiempo ni energía. Reescribir las notas más recientes resulta más rápido que transportarlas por el pasillo de ida y vuelta, y de paso libera una buena porción de almacenamiento.
Piezas de apoyo: MHC, Engram y DS-Spark
Tres piezas de apoyo completan la columna vertebral. Una es MHC de una sola pasada, que reduce el tráfico de memoria de la GPU al alinear operaciones sucesivas para que se ejecuten juntas en lugar de una tras otra. En el trabajo de contexto largo, el modelo transporta valores intermedios hacia la memoria y de vuelta miles de millones de veces; cada viaje es diminuto, pero multiplicado se convierte en el cuello de botella, y fusionar pasos recorta ese tráfico. Otra es Engram, un módulo de memoria separado con 168 mil millones de parámetros que vive en RAM de servidor más barata en lugar de la costosa memoria de GPU y contiene hechos estáticos como fechas, capitales y otros conocimientos fijos. La analogía del abogado en el video ayuda: el abogado senior se centra en la estrategia mientras un asistente trae citas precisas bajo demanda, manteniendo la mente costosa libre para el razonamiento. La tercera es DS-Spark, ya descrita en un explicador aparte, que permite al modelo emitir varias palabras a la vez en lugar de una por una. Juntas mantienen la memoria rápida enfocada en el razonamiento activo, no en transportar intermedios o memorizar trivialidades.
Cuando las piezas se combinan, la curva de costo se aplana de una manera que parece romper las reglas. El video señala la Figura 2, donde el cómputo en el eje vertical se traza contra el tamaño de la ventana de contexto en el eje horizontal. Escalar la ventana de 4 000 tokens estándar a 1 millón de tokens, aproximadamente 700 000 palabras o una base de código mediana, deja la curva de decodificación de V4.1 Flash casi horizontal. Un documento de una página y un paquete de mil páginas cuestan una cantidad similar de energía por palabra en el momento de la generación, desafiando la expectativa habitual de que un contexto más grande debe implicar un cómputo proporcionalmente mayor. Las generaciones anteriores suben; esta se mantiene nivelada. Para un equipo que se describe como falto de cómputo, el mensaje es directo: optimizar el software para que el hardware no tenga que trabajar tan duro.
El rendimiento no es solo una historia de eficiencia. En DeepSWE v1.1, el modelo obtiene 74,2, esencialmente igual o un poco por delante de GPT6 Astra con 74. En CyberGym para seguridad, registra 88,1 frente a 84,5 del mejor competidor cerrado, y en AutomationBench 54,8 frente a 50,3. Terminal-Bench 3.0 es el contrapunto con 30,0 frente a 43,3, donde lidera Claude Opus 5, un claro recordatorio de que las tareas más difíciles centradas en terminales todavía favorecen a los gigantes. LiveBench lo clasifica como el mejor modelo abierto, y el índice de Val para tareas de trabajo de conocimiento también lo coloca primero. Una arena de diseño de terceros citada en la cobertura de apoyo alcanzó el 98% del promedio de Astra mientras reducía el costo por tarea de $1.61 a $0.023, alrededor del 1.4% del precio, y reducía el tiempo de 11.1 a 5.3 minutos. La velocidad de salida a través de la API supera los 200 tokens por segundo, aproximadamente cuatro veces GPT6 en la comparación mostrada, y el tiempo hasta el primer token está entre los más bajos reportados. El informe técnico es franco: sigue existiendo una brecha en las tareas de agente más difíciles orientadas a la ciencia que exigen conocimiento experto del dominio.
En conjunto, V4.1 Flash es menos un avance único que un conjunto de decisiones alineadas: atención de ventana deslizante para un enfoque local ajustado, cerebro dividido que casi reduce a la mitad el cómputo de prefill, CSA2 con Full, Reindex y Reuse más un grupo de candidatos jerárquico que exprime la caché KV en dos órdenes de magnitud más allá de la generación anterior, replay acotado que elimina y recomputa 128 tokens en lugar de transportar la memoria local por el almacenamiento, una ruta MHC fusionada que reduce el tráfico, un almacén Engram que mueve hechos estáticos a RAM barata, y DS-Spark para emisión de múltiples palabras. El resultado es un MoE multimodal de 1 millón de tokens, entrenado con 45 billones de tokens, que admite hasta 384 000 tokens de salida, ofrece niveles de razonamiento low, high y max, y pide alrededor de un cuarto de la memoria de alto ancho de banda y un octavo del SSD de su predecesor. Publicado como deepseek-flash, con los nombres heredados retirados y pesos abiertos para descarga local, señala una intención: este Frankenstein de eficiencia está hecho para probarse en bases de código reales de agentes, no para admirarse como una gráfica de laboratorio.
Momentos clave
- Apertura — objetivo de frontera bajo restricciones
- Caché KV: la imagen del escritorio y el archivador
- Cerebro dividido: mitades codificador y decodificador
- Intercambio CSA2: tres modos y tablas de índice
- Guardián y grupo de candidatos: de 1M a 16K
- Replay acotado SWA: recomputar 128 tokens
- MHC, Engram, DS-Spark y la curva plana
- Puntuaciones, velocidad y costo: cierre con pesos abiertos
Comentario de la IA
"«Lo que más me llamó la atención es la negativa a perseguir hardware y la decisión de ajustar el software; reducir las notas de unos 390 000 bytes a 890 bytes se siente como un sistema de archivo más inteligente que un campus más grande, y publicarlo con pesos abiertos hace que la afirmación sea comprobable.»"
Evaluación de la IA
Si primero se presenta el mejor argumento en contra, el panorama se vuelve más cauto: la compresión y el intercambio centrados en software son llamativos en las facturas de memoria y la latencia, pero la profundidad del razonamiento y el conocimiento de dominio poco común no mejoran automáticamente al mismo ritmo que la eficiencia. El propio video lo concede: en las tareas de agente más difíciles orientadas a la ciencia, los modelos cerrados más grandes siguen adelante. Si la lectura se ancla solo en bancos de pruebas de codificación y automatización, extrapolar una paridad generalizada con la frontera exagera la evidencia. Las ventajas de costo también dependen de una única instantánea de precios de una arena de diseño; cambia el tipo de tarea, el número de repeticiones o los precios del proveedor, y una cifra destacada como 1,4% puede moverse.
Los límites metodológicos merecen una nota. La curva aplanada describe el costo promedio de decodificación por palabra, no el costo total del trabajo; el costo total sigue aumentando con un contexto más grande, solo que más lentamente. Las tasas de compresión KV llegan con cuantificación FP4 y entrenamiento consciente de la cuantificación, que preservan la ganancia cuantitativa pero exigen controles adicionales de estabilidad numérica en cadenas largas. Reducir un campo de un millón de tokens a un grupo de candidatos de 16 384 entradas hace que la precisión dependa de la construcción del grupo; los contextos fuera de distribución podrían degradar la tasa de acierto del grupo y dejar a las capas posteriores sin posibilidad de recuperarse. El replay acotado es extremadamente barato para una ventana de 128 tokens, pero un estado en el que el historial conversacional se elimina activamente plantea preguntas sobre cadenas largas de referencia en agentes de producción y necesita pruebas a nivel de producto.
La procedencia y la verificabilidad también importan. La narrativa se apoya en el informe técnico de DeepSeek y en la interpretación de un solo video, por lo que las ejecuciones independientes pueden mostrar variaciones, especialmente en velocidad, tiempo hasta el primer token y costo detallado. Las cifras centrales sí se replican entre fuentes: 552B totales con 8B de prefill y 16B de decodificación activos, contexto de 1M, KV global de 890 bytes, aproximadamente un cuarto de la memoria de alto ancho de banda y un octavo del SSD frente a la generación anterior aparecen en la nota oficial y en los resúmenes de Meta AI Labs y The Decoder. Aun así, «igualar la frontera» depende del banco de pruebas; ser fuerte en DeepSWE y CyberGym y quedarse atrás en Terminal-Bench se describe mejor como un cuadro de mando equilibrado que como un único puesto destacado. La comprobación más sólida es volver a ejecutar las mismas instrucciones localmente con vLLM o SGLang en tu propia carga de trabajo.
La conclusión práctica varía según el equipo. Para los equipos de agentes que viven en contextos largos, bases de código grandes y uso de herramientas en múltiples turnos, V4.1 Flash es un valor predeterminado convincente; los ahorros de memoria y costo fluyen directamente al presupuesto de iteración y los pesos abiertos permiten pruebas locales. Para los productos donde el tiempo hasta el primer token es crítico, los 200 tokens por segundo reclamados y la baja latencia inicial son significativos. Cuando el trabajo se inclina hacia la computación científica de nicho, la verificación formal o las largas secuencias de terminal del tipo Terminal-Bench, los modelos cerrados más grandes deberían seguir siendo la referencia. Para los proyectos intermedios, el camino más saludable es ejecutar los niveles de razonamiento low, high y max lado a lado en las mismas tareas y trazar tu propia curva de costo-calidad; la eficiencia solo se acumula cuando se mide contra la precisión en tu dominio.
Fuentes
7 enlaces; 3 de ellos también citados por 4 otras noticias. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
- @youtube https://www.youtube.com/watch?v=MImgH4KMtj8
- @deepseek https://www.deepseek.com/en/news/deepseek-v4-1-flash/
También citado por: DeepSeek V4.1 Flash's Insane Architecture: Shared Memory That Shrinks KV Cache 437x · DeepSeek V4.1 Flash Takes Over for Pro: Asymmetric Design Joins the Frontier-Agent Race · AI Tier List Reset: GPT-6 Astra Takes the Crown as Subscription Math Rewrites the Ranks · DeepSeek V4.1 Flash: Cheap, Fast and Open — yet Rough on the Test Bench
- @metaailabs https://metaailabs.com/deepseek-ai-released-deepseek-v4-1-flash-with-1m-context-fp4-kv-cache-and-cross-layer-attention-reuse/
- @the-decoder https://the-decoder.com/new-deepseek-model-v4-1-flash-cuts-memory-needs-for-ai-agents/
También citado por: DeepSeek V4.1 Flash: Cheap, Fast and Open — yet Rough on the Test Bench
- @theregister https://www.theregister.com/ai-and-ml/2026/09/11/deepseeks-new-model-sets-a-template-for-powerful-llms-that-run-lean/5295715
- @huggingface https://huggingface.co/blog/deepseekv4
- @beam https://beam.ai/agentic-insights/deepseek-v4-1-flash-ai-agents
También citado por: DeepSeek V4.1 Flash: Cheap, Fast and Open — yet Rough on the Test Bench
inteligencia artificial · deepseek · v4.1 · flash · división · cerebro · nodesdaily