Volver al inicio

DeepSeek V4.1 Flash: Barato, rápido y abierto — pero áspero en el banco de pruebas

El 10 de septiembre, DeepSeek lanzó V4.1 Flash, un modelo de pesos abiertos de 552 mil millones de parámetros con un contexto de un millón de tokens, una licencia MIT y puntuaciones de referencia que desafían a los gigantes cerrados. Las pruebas prácticas de Matthew Berman revelan el lado más áspero de la historia.

Importado a Nodesdaily: (UTC+03:00)
Ver en YouTube — U-rsvXds9ck
Opciones de lectura

La voz del dispositivo no está disponible en este navegador.

Lupa de conceptos

Elige un término técnico de esta vista para leer su definición general, un ejemplo didáctico y su uso en el artículo.

No se encontró ningún término de nuestro glosario en esta vista. El glosario aún no cubre todos los términos.

DeepSeek lanzó formalmente V4.1 Flash el 10 de septiembre: un modelo de 552 mil millones de parámetros con un contexto de un millón de tokens y pesos abiertos con licencia MIT. A través de la API, responde a deepseek-flash, y los nombres heredados v4-flash ahora se dirigen a él. La afirmación principal es audaz: las puntuaciones se sitúan en la misma liga que los gigantes cerrados de la generación anterior, Opus 5 y GPT-5.6 Sol. El video enmarca esto dentro de un ritmo familiar de seis meses: la frontera avanza primero, los modelos abiertos alcanzan ese nivel medio año después, y seis meses después de eso, el poder llega a las máquinas locales.

El marcador publicado tiene puntos destacados claros: 74.2 en DeepSWE v1.1 para ingeniería de software, un poco por encima de Opus 5 con 74.0; 88.1 en CyberGym para seguridad; 54.8 en AutomationBench. Sin embargo, la tabla tiene dos caras: en Terminal-Bench 3.0 se detiene en 30.0, muy por detrás de Opus 5 con 43.3. Y en un campo de diseño de terceros, alcanza el 98 por ciento de la puntuación de Astra mientras gasta alrededor de 2.3 centavos por tarea; Astra cobra $1.61 por el mismo trabajo.

La arquitectura es la parte más interesante. El modelo utiliza un nuevo esqueleto codificador-decodificador de 40 capas: 20 capas leen la entrada, 20 producen la salida. La lectura activa solo 8 mil millones de parámetros por token, la generación 16 mil millones; el resto de los 552 mil millones permanecen inactivos en ese momento. Esa es la idea de la mezcla de expertos en pocas palabras: decidir qué mini-especialista posee la pregunta y entregársela. Un mecanismo de atención dispersa comprimida reduce aún más los costos de texto largo.

El video prueba la afirmación de velocidad en vivo: una muestra de mil palabras se transmite en aproximadamente seis segundos, del orden de 200 tokens por segundo. El anfitrión compara la sensación con la emoción inicial de Groq, y señala que el modelo supera al anterior buque insignia V4 Pro. Para cargas de trabajo de agentes que siguen leyendo nuevas entradas, ese ritmo puede importar más que cualquier puntuación bruta, porque el tiempo de espera se factura igual que el cómputo.

La ganancia de memoria es aún más sorprendente. La caché de contexto ocupa aproximadamente una cuarta parte de la memoria rápida y una octava parte del espacio SSD que necesitaba su predecesor. La comparación de la compañía con V1 es asombrosa: la caché por token se ha reducido 437 veces. Para los agentes que procesan contextos largos paso a paso, eso significa menos memoria GPU ocupada y una factura de servidor más pequeña.

La medida llega en medio de una verdadera crisis. Se dice que los precios spot de HBM3E son de cuatro a cinco veces los niveles de los contratos a largo plazo, con Samsung acaparando el 70 por ciento de la capacidad hasta 2031. El 10 de septiembre, Reuters informó que los fabricantes de chips chinos estaban aumentando los precios de los procesadores a medida que la inflación de la memoria hacía mella. Teléfonos y computadoras más caros con memoria reducida son humo del mismo fuego; DeepSeek busca la respuesta en los algoritmos.

La lista de precios es agresiva: 15 centavos por millón de tokens de entrada fuera de horas pico, 30 centavos en horas pico. La entrada en caché es casi gratuita a 0.3 centavos por millón. La salida oscila entre 60 centavos y $1.20 por millón. La tarifa dual existe para atraer cargas de trabajo corporativas a las horas en que las GPU están inactivas. Y como los pesos son abiertos, nadie tiene que entregar sus datos a DeepSeek.

La tesis económica del video es clara: el precio de la mejor respuesta y el precio de una respuesta "suficientemente buena" difieren en órdenes de magnitud, con la frontera cerrada cobrando alrededor de $50 por millón de tokens mientras que esta clase habla en centavos. Para trabajos de gran volumen como sitios web y tuberías de PDF, que el anfitrión sitúa en el 95 por ciento del uso, este nivel es más que capaz. La compañía incluso documenta sus técnicas en un informe abierto sobre el que una startup podría construir.

El banco de pruebas es menos generoso que el marcador. La simulación del cubo de Rubik se escribe en 12 segundos y parece bien a primera vista, pero al presionar "mezclar" los colores cambian solos en lugar de por movimiento. El botón de "resolver" no produce una solución real; reproduce los movimientos hacia atrás hasta el inicio. El mismo fallo aparece en el sitio de la compañía y a través de Codex, y el anfitrión dice que ningún modelo ha colapsado en esta prueba durante un año y medio.

Siguen dos pruebas más. En el ejercicio Paintbench del equipo, el modelo convierte un retrato de referencia en una pieza abstracta, con escasez de detalles, sin el trabajo de pincel en capas de Astra. La demostración 3D de "bala a través del agua" se envía dentro de una buena carcasa de aplicación con física mediocre. El veredicto es justo: un caballo de batalla barato, rápido y eficiente; si supera a GLM 5.3 es una pregunta para otro video.

Visualization: nodesdaily AI

Comentario de la IA

"« Mi lectura: este lanzamiento demuestra que los modelos abiertos mantienen su ritmo de seis meses de retraso; la verdadera noticia no es la tabla de referencia sino la arquitectura que reduce la factura de memoria. El fiasco del cubo de Rubik honestamente marca los límites de esta clase. »"

Evaluación de la IA

Primero el acero: estas puntuaciones provienen del propio informe de la compañía. El día del lanzamiento no existía ninguna medición independiente; Artificial Analysis no había probado el modelo y su página de Hugging Face no mostraba ningún proveedor de servicios. En tablas como Terminal-Bench 3.0, Opus 5 lidera por un amplio margen. Por lo tanto, el veredicto de "nivel de frontera" se basa en marcadores seleccionados y debe leerse como una afirmación no verificada.

Las propias pruebas del video son demostraciones de una sola solicitud y un solo intento; no tienen peso estadístico. Más importante aún, la compañía establece los límites ella misma: en las tareas de agente con sabor científico más difíciles y en el análisis de imágenes, la brecha con los modelos gigantes persiste. Una puntuación baja como 15 en Exploit Gym es la esquina barrida de la tabla. El colapso en las pruebas de juego puede ser una señal temprana de esos límites.

Dos advertencias sobre la verificabilidad. Primero, el sufijo '.1' sugiere una puesta a punto, pero debajo se encuentra un modelo base completamente nuevo mientras que un buque insignia de 1.6 billones de parámetros se retira. Segundo, los precios brillan más en las tarifas fuera de pico. Antes de decidir, probaría mi propia carga de trabajo con precios de pico y contra mediciones independientes.

Mi práctica se configura así: para trabajos de agente de contexto largo y configuraciones con memoria limitada, este modelo es el primer candidato a probar; donde la precisión final se compra con dinero, la frontera cerrada aún reina. Confiaré en mis propias mediciones por encima del precio, y los pesos abiertos hacen que esa medición sea libre de riesgos.

Fuentes

10 enlaces; 5 de ellos también citados por 5 otras noticias. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

deepseek · v4.1 flash · pesos abiertos · moe · benchmarks · hbm · ia

Seguir el tema

Antes de esta noticia

Un breve orden de lectura de noticias anteriores vinculadas a este evento por un editor.

Evidencia y fuentes

Revisa los pasajes permitidos, sus versiones y su origen.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…