Volver al inicio

La arquitectura descabellada de DeepSeek V4.1 Flash: memoria compartida que reduce la caché KV 437x

Cubierto por Two Minute Papers, DeepSeek V4.1 Flash incluye 552B de parámetros MoE y contexto de 1M de tokens mientras reduce la caché KV 437x vs V1 y 4x vs el Flash anterior — mediante memoria compartida entre capas, CSA2 y compresión FP4.

Importado a Nodesdaily: (UTC+03:00)
Ver en YouTube — vIHw_2VjSUw
Opciones de lectura

La voz del dispositivo no está disponible en este navegador.

Lupa de conceptos

Elige un término técnico de esta vista para leer su definición general, un ejemplo didáctico y su uso en el artículo.

No se encontró ningún término de nuestro glosario en esta vista. El glosario aún no cubre todos los términos.

DeepSeek V4.1 Flash ocupa el centro del episodio «Insane New Architecture» de Two Minute Papers, que abre con pura velocidad y dos afirmaciones audaces: en algunos benchmarks Flash puede superar a modelos de la clase Claude Opus y a Kimi K3, y vence de forma fiable al propio DeepSeek V4. El presentador pone cifras al costo para hacerlo tangible — ejecutar V4 Pro en local requiere unos 300.000 $ en hardware, mientras que Flash hace el mismo trabajo por aproximadamente un cuarto. La curva apunta hacia un agente de bolsillo en un año, ofrecido como optimismo cauteloso y no como hype.

Qué se volvió más rápido, qué se volvió más pequeño: la anatomía del 437x

La idea más llamativa es que el modelo es enorme y pequeño a la vez. Enorme porque la columna vertebral tiene 552 mil millones de parámetros con hasta un millón de tokens de contexto — el video señala «más de 500 mil millones». Pequeño porque la caché KV que sostiene el contexto se desploma: 437x más pequeña que la de V1 de hace tres años y 4x más pequeña que la de V4 Flash de hace apenas meses. El abstract del artículo arXiv 2609.19969 fija la cifra: huella global reducida a 890 bytes por token, aproximadamente un cuarto de DeepSeek-V4-Flash en HBM. Con SWA Bounded Replay, la huella persistente en SSD o memoria del host cae a cerca de un octavo de V4-Flash. Para cargas de trabajo de agentes de largo horizonte e intensivas en entrada, eso ataca directamente el cuello de botella de cómputo, almacenamiento y ancho de banda.

¿Cómo se logra la reducción? El video lo nombra: Compressed Sparse Attention 2, CSA2. En un Transformer clásico cada capa conserva su propia memoria KV; DeepSeek V4.1 Flash la comparte entre capas. No todos tienen que recordar todo — hay una memoria compartida. La dificultad es que distintas capas necesitan vistas distintas de la misma historia. La solución es un Causal Encoder-Decoder de 40 capas, CED: un codificador causal de 20 capas proyecta una memoria global a partir de sus estados ocultos finales, y un decodificador de 20 capas lee de esa memoria global en lugar de derivar el KV de sus propios estados. Añade caché KV en FP4 y tanto la caché global residente en HBM como la caché persistente residente en SSD caen drásticamente.

Números de la arquitectura: 8B de prefill, 16B de decode, 45T de tokens

La asimetría importa para la economía de los agentes. El modelo activa 16B de parámetros por token durante el decode pero solo 8B durante el prefill, lo que reduce a la mitad el costo del prefill para trabajos intensivos en entrada. DeepSeek informa haber racionalizado la arquitectura V4, añadido extensiones eficientes y preentrenado sobre un corpus multimodal de 45T de tokens seguido de un amplio post-entrenamiento para escenarios de agentes textuales y multimodales. El anuncio del 10 de septiembre de 2026 en deepseek.com lo posiciona como el miembro más pequeño de la nueva familia con comprensión visual nativa, prometiendo inferencia más rápida y mayor rendimiento. Los checkpoints están abiertos en Hugging Face.

El video no se detiene en la arquitectura; muestra dos sondas de capacidad concretas. Primero, comprensión visual nativa — se le da al modelo la imagen de un menú de juego icónico y se le pide escribir un juego que la reproduzca. Segundo, reproducción de física — en el artículo del honey-coiling, GPT-6 Astra clava el resultado como «absolutamente impresionante», Opus 5.1 acierta la física con un renderizado algo más débil, y Flash se presenta a unos cuantos artículos de alcanzar ese nivel. El presentador insiste en mostrar la verdad más allá de los titulares y señala, con un aparte irónico, que YouTube dejó de recomendar sus artículos de simulaciones físicas.

La trampa y la factura: un modelo que piensa mucho y quema tokens

La trampa al final reequilibra la historia. A V4.1 Flash le gusta pensar y quema muchos tokens. No es caro por token, pero el volumen total es alto. Con hardware puedes ejecutarlo gratis; sin él, la nube de GPU de Lambda se presenta como el puente práctico — el presentador comenta que usa Lambda para reproducir artículos en minutos y probar ideas rápido. Cada nuevo artículo de DeepSeek, dice el argumento, baja el costo de inferencia para todos, lo que ayuda directamente a médicos y científicos. Pesos abiertos más un artículo abierto mantienen intacto el hilo de «la ciencia abierta gana».

Tomando distancia, la locura de V4.1 Flash no es el músculo bruto sino la economía de la memoria. El uso compartido entre capas, la proyección de codificador a decodificador y la compresión FP4 reducen juntas un contexto de un millón de tokens a un rastro de 890 bytes por token mientras empujan el rendimiento por encima de la línea base. Reducir una barrera local de 300.000 $ a un cuarto y a la mitad la activación del prefill convierte la frase «en tu bolsillo en un año» de especulación en hoja de ruta de ingeniería. Al contar la reducción en dos escalas a la vez — 437x vs V1 y 4x vs V4 Flash — el video ofrece un marco compacto para quien sigue las arquitecturas.

Momentos clave

  1. Intro — por qué entusiasma V4.1 Flash
  2. Sorpresa de rendimiento — venciendo a V4 y a la clase Opus
  3. Comprensión visual — de la imagen de menú al juego
  4. El secreto de la reducción — CSA2 y memoria compartida
  5. Dentro de la arquitectura — CED 20+20 y FP4
  6. Demo de física — honey coiling, Astra vs Opus
  7. La trampa — pensar mucho, quemar tokens

Comentario de la IA

"«Lo que más me llamó la atención aquí es la inversión de la ortodoxia del 'modelo más grande'. DeepSeek agrandó el modelo mientras reducía la memoria — para mí, ese es el verdadero umbral para que los agentes quepan en nuestros bolsillos.»"

Evaluación de la IA

En su mejor versión, DeepSeek golpea la economía de los agentes donde más duele. El costo del contexto largo lleva tiempo atascado en «el prefill es caro, el KV está hinchado, el HBM/SSD es el cuello de botella»; CED más CSA2 más FP4 desatan ese nudo de una vez, y lo hacen con 890 bytes por token medibles, no un eslogan. La división de 8B en prefill frente a 16B en decode es una de las raras victorias arquitectónicas que bajan directamente la factura para agentes reales intensivos en entrada.

Las limitaciones importan. El video es corto y de fuente única; las líneas de rendimiento se matizan como «en algunas pruebas» sin conjunto de datos, tolerancia ni dispersión estadística en pantalla. Los anclajes de costo como 300.000 $ y un cuarto oscilan rápido según el hardware y la configuración de memoria — los espectadores no deberían presupuestar solo con la anécdota. La demo física del honey-coiling es impactante, pero la reproducción de un solo artículo no es prueba de generalidad; otras físicas y dominios podrían no transferirse con la misma fidelidad.

En cuanto a riesgos y verificabilidad, arXiv 2609.19969 y los checkpoints de Hugging Face refuerzan la base, y el anuncio de DeepSeek del 10 de septiembre de 2026 confirma la arquitectura y el preentrenamiento de 45T de tokens. Aún quedan por reproducir de forma independiente: qué tan fluido se comporta SWA Bounded Replay en producción, dónde empieza a morder la calidad el KV FP4 en contexto muy largo, y qué cargas sostienen realmente 1M de tokens. El lado del quemado de tokens también necesita transparencia: aunque el costo unitario sea bajo, el costo total fluctúa a medida que se alargan las trazas de razonamiento.

En la práctica, los equipos que ejecutan agentes de contexto largo, RAG o asistentes multimodales deberían tratar V4.1 Flash como una prueba seria para los presupuestos de memoria y prefill — en local si tienes hardware, en GPU alquilada como Lambda si no. Para chat de contexto corto y sensible a la latencia la ganancia es más estrecha, y el carácter de «le gusta pensar» implica contabilizar tokens por respuesta. Pesos abiertos más un artículo abierto hacen la prueba de baja fricción — mide en tu propio conjunto de datos antes de escalar.

Fuentes

6 enlaces; 2 de ellos también citados por 4 otras noticias. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

deepseek · inteligencia artificial · caché kv · csa2 · moe · nodesdaily

Seguir el tema

Antes de esta noticia

Un breve orden de lectura de noticias anteriores vinculadas a este evento por un editor.

Evidencia y fuentes

Revisa los pasajes permitidos, sus versiones y su origen.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…