DeepSeek rompió una regla no escrita con esta versión: el modelo llamado Flash está asumiendo temporalmente el trabajo que antes iba al buque insignia Pro. A partir de las 04:00 UTC del 14 de septiembre de 2026, las solicitudes Pro se enrutan a V4.1 Flash con tarifas de Flash hasta que llegue el próximo modelo Pro. No es una opción secundaria para tráfico barato; es la línea principal luciendo una insignia de Flash por un tiempo.
La antigua jerarquía era simple. V4 Pro era el peso pesado con 1,6 billones de parámetros y 49 mil millones activos por token, el modelo que elegías para máxima potencia. V4.1 Flash llega con una columna vertebral de 552 mil millones de parámetros, más pequeña pero aún enorme. El titular, por tanto, no es el número de parámetros, sino cuánto del modelo se despierta en cada etapa del trabajo.
La idea central es una división asimétrica de codificador-decodificador causal. En términos generales, la lectura y la escritura corren a cargo de equipos distintos: unos 8 mil millones de parámetros activos organizan el prompt, la base de código y las salidas de las herramientas durante la lectura, y luego unos 16 mil millones toman el relevo cuando el modelo escribe respuestas y elige la siguiente llamada a una herramienta. La imagen mental es la de un equipo que ordena un expediente enorme y entrega las piezas destiladas a un equipo más fuerte que redacta el plan.
La memoria es donde el diseño paga el alquiler. Las ejecuciones largas de agentes acumulan un registro creciente de contexto procesado, y cargar ese registro se vuelve caro a medida que las ventanas se estiran hacia un millón de tokens. DeepSeek cita alrededor de 890 bytes de caché global por token, aproximadamente un cuarto de la generación anterior en memoria activa y un octavo en almacenamiento persistente. Una caché más pequeña significa menos memoria de alta banda ancha por ejecución activa, menos SSD por sesión almacenada y menos trabajo repetido cuando el agente revisa material anterior.
Luego vienen las tablas. En Terminal-Bench 2.1, el vídeo reporta 90,6 para Flash frente a 89,1 para Claude Opus 5 y 88,8 para GPT-5.6 Sol; en DeepSWE reporta 74,2 frente a 74,0 y 73,0; en AutomationBench la brecha se amplía a 54,8 frente a 50,3 y 45,8. Los primeros comentarios independientes añaden matices: un índice de inteligencia sitúa a Flash 40 puntos por encima de su propio Pro, que obtiene 36, con rivales nacionales aún más altos, y una prueba de arena de diseño lo coloca a un punto y medio de un modelo cerrado mucho más caro, por una fracción del costo por diseño terminado.
El modelo no trabaja solo, y por eso la actualización del Harness importa. DeepSeek presenta el Harness como todo lo que rodea al cerebro: herramientas, archivos, acceso al shell, planificación, subagentes, sesiones, almacenamiento, programación. La nueva versión mantiene vivo el contexto costoso cuando las instrucciones del sistema cambian a mitad de tarea, expone con más claridad las estadísticas de aciertos de caché y de tokens, y actualiza los runtimes opcionales de subagentes. La versión 0.1.5 también apuesta por la carga de archivos y las vistas previas laterales, empujando al Harness de un simple ejecutor hacia un banco de trabajo diario.
Los pesos abiertos con licencia MIT completan el panorama, con una salvedad que el vídeo declara sin rodeos. Los desarrolladores ganan inspección, pilas de inferencia compatibles y libertad frente a una única API cerrada, pero la columna vertebral completa todavía tiene que vivir en algún lugar muy por encima de un portátil estándar. Así que la decisión se divide en tres: los creadores de APIs obtienen un lector más barato para agentes largos, los equipos de infraestructura obtienen control al precio de un hardware serio, y quien busque un único campeón para cada tarea obtiene evidencia de pertenencia a la conversación de frontera en lugar de prueba de una corona. La tesis de esta versión es la asimetría: ser barato donde la lectura lo permite y fuerte donde decidir lo exige.
Comentario de la IA
""Mi lectura: lo interesante aquí no es una puntuación más alta, sino una lectura más barata. Si las ejecuciones largas de agentes consisten sobre todo en gestionar el contexto, gastar menos en leer y más en decidir es la asimetría correcta — pero solo enrutaré tráfico de producción después de que reruns independientes confirmen las tablas del proveedor.""
Evaluación de la IA
La objeción más fuerte se escribe sola: son tablas publicadas por el proveedor para justificar el retiro de un buque insignia, y el mismo checkpoint supuestamente abarca del 65,5 al 74,2 por ciento en DeepSWE según el harness que lo rodee. Las señales independientes son mixtas por ahora: un índice sitúa a Flash 40 puntos por delante de su propio Pro, que obtiene 36, pero detrás de dos rivales nacionales, mientras que otros análisis señalan puntos débiles en conjuntos de estilo programático y de ciencia pesada. Eso no hace que la versión esté vacía, pero hace que las puntuaciones titulares sean provisionales en lugar de definitivas.
Lo que el vídeo no prueba también importa: estabilidad a largo plazo en reposos desordenados, comportamiento ante instrucciones cambiantes a mitad de tarea durante horas, facturación real en horas punta frente a horas valle para agentes sostenidos, y datos de revisión de seguridad. La actualización del Harness aborda parte de esto con cambios de instrucciones que preservan la caché y mejores estadísticas de caché, pero la visibilidad de las estadísticas no es lo mismo que un mes medido de incidentes de producción. También querría cifras de memoria y almacenamiento de un despliegue neutral, y no solo las proporciones de un cuarto en memoria y un octavo en almacenamiento del material de lanzamiento.
La procedencia moldea cómo leo cada cifra. DeepSeek publicó las victorias mientras anunciaba que las solicitudes Pro pasan a precios de Flash hasta que llegue el próximo Pro, con socios ya alineados detrás del nuevo modelo. Así que mi lista de verificación antes de cualquier migración es corta: volver a ejecutar Terminal-Bench con una versión fija del harness, comparar el índice de inteligencia independiente en lugar de una sola tabla del proveedor, confirmar los precios reales de los proveedores para las ventanas punta y valle, y leer las notas de la versión del Harness en lugar de la prosa del lanzamiento. Los números que sobreviven a esa prueba ganan tráfico; el resto se quedan en diapositivas.
Mi conclusión práctica es triple. Si construyes agentes de código, Flash merece una prueba controlada porque la estructura de costos de la lectura más la caché cambia la economía unitaria de las ejecuciones largas. Si quieres autoalojar, la licencia MIT da control, pero la columna vertebral de 552 mil millones de parámetros todavía exige hardware de aceleración serio, así que el control es real y barato no es. Y si quieres un modelo el más fuerte para todo, esta versión no lo resuelve; le gana a Flash un asiento en la mesa de los agentes de frontera, ni más ni menos.
Fuentes
9 enlaces; 3 de ellos también citados por 4 otras noticias. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
- @youtube https://www.youtube.com/watch?v=tQ2T__1XfVU
- @deepseek https://www.deepseek.com/en/news/deepseek-v4-1-flash/
También citado por: DeepSeek V4.1 Flash's Insane Architecture: Shared Memory That Shrinks KV Cache 437x · DeepSeek V4.1 Flash and the Split Brain: Challenging Frontier Models with 890-Byte Notes · AI Tier List Reset: GPT-6 Astra Takes the Crown as Subscription Math Rewrites the Ranks · DeepSeek V4.1 Flash: Cheap, Fast and Open — yet Rough on the Test Bench
- @huggingface https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
También citado por: DeepSeek V4.1 Flash's Insane Architecture: Shared Memory That Shrinks KV Cache 437x
- @techtimes https://www.techtimes.com/articles/327163/20260910/deepseek-v41-flash-cuts-agent-memory-costs-fourfold-new-architecture.htm
- @orcarouter https://www.orcarouter.ai/blog/deepseek-v4-1-new-base-model
También citado por: DeepSeek V4.1 Flash: Cheap, Fast and Open — yet Rough on the Test Bench
- @technode https://technode.com/2026/09/10/deepseek-releases-harness-0-1-5-with-v4-1-flash-support-file-uploads-and-sidebar-previews/
- @kingy https://kingy.ai/blog/deepseek-v4-1-flash-local-hardware-requirements/
- @decrypt https://decrypt.co/377917/deepseek-openai-gpt-6-astra-design-benchmark
- @gate https://www.gate.com/news/detail/deepseek-v41-flash-achieves-40-point-intelligence-score-costs-7x-less-than-24185950
deepseek · v4.1 flash · agentes de código · benchmarks · pesos abiertos · harness