Volver al inicio

DeepSeek V4.1 Flash se enfrenta a Gemini 3.8 Flash: un duelo de programación en cinco prompts

El vídeo comparativo de Ömer Göçmen enfrenta a dos modelos flash lanzados con días de diferencia: DeepSeek V4.1 Flash y Gemini 3.8 Flash. Tras repasar las puntuaciones oficiales y los precios, ambos modelos se prueban con cinco prompts aplicados (parque de atracciones, app de datos sísmicos, sistema operativo en el navegador, conversión de plano 2D a casa 3D y juego de granja). El autor, que al principio favorecía a DeepSeek, acaba eligiendo Gemini.

Importado a Nodesdaily: (UTC+03:00)
Ver en YouTube — kUOhikNvG9o
Opciones de lectura

La voz del dispositivo no está disponible en este navegador.

Lupa de conceptos

Elige un término técnico de esta vista para leer su definición general, un ejemplo didáctico y su uso en el artículo.

No se encontró ningún término de nuestro glosario en esta vista. El glosario aún no cubre todos los términos.

La primera mitad de septiembre concentró dos lanzamientos en el segmento flash: Google anunció Gemini 3.8 Flash junto con una variante Cyber centrada en seguridad el 2 de septiembre, mientras que DeepSeek publicó V4.1 Flash el 10 de septiembre y retiró las versiones flash anteriores. El vídeo de Ömer Göçmen se sitúa exactamente en esa intersección, intentando responder cuál de los dos modelos aparentemente empatados es la mejor opción para el trabajo diario mediante cinco pruebas aplicadas.

Primero, la hoja de puntuaciones oficial: según la documentación de la API de DeepSeek, V4.1 Flash obtiene 82,7 en Terminal Bench 2.1, 54,4 en DeepSWE, 76,7 en Cybergym y 70,3 en Toolathlon; el modelo llegó como una beta multimodal por tiempo limitado y se llama deepseek-flash en la API. La lectura de las gráficas en el vídeo coincide con este panorama: el modelo parece por delante de sus rivales de pesos abiertos mientras se sitúa ligeramente por debajo del nivel de los buques insignia.

La historia de la arquitectura es familiar: en el diseño de mezcla de expertos de 552 mil millones de parámetros, solo unos 8 mil millones de parámetros activos por token trabajan en cada prompt en lugar de toda la red, y de ahí viene la velocidad. Los precios tienen tres niveles: DeepSeek cobra 0,15 $ de entrada y 0,60 $ de salida por millón de tokens, Gemini 3.8 Flash cobra 0,75 $ y 3,75 $, y el asiento más caro de la tabla del vídeo es el de GLM con 1,40 $ y 4,40 $. La tarifa de Gemini es una oferta de lanzamiento válida hasta fin de año, así que la brecha actual podría no durar.

El montaje de pruebas consta de cinco aplicaciones: un parque de atracciones en 3D, una app de datos sísmicos, un sistema operativo en el navegador, una conversión de plano 2D a casa 3D y un juego de granja. DeepSeek funciona mediante OpenCode Go en el ajuste alto, Gemini mediante su propia infraestructura de servicio, y cada prueba se puntúa sobre 10. Nótese que el evaluador es el propio autor del vídeo; vuelvo sobre los límites de ese método en la sección de evaluación.

En la prueba del parque de atracciones ambos modelos construyen modos de día, tour y festival; la noria y la montaña rusa obligatorias aparecen en ambos. La brecha se abre en los detalles: Gemini añade una cámara montable al tren, incluye fuegos artificiales no solicitados en el modo festival y logra transiciones físicas más fluidas. DeepSeek obedece el prompt al pie de la letra pero nunca va una letra más allá; las puntuaciones se leen 8,5 a 7,8.

En la app sísmica las tarjetas de estadísticas son correctas en ambos lados; el mapa decide. Gemini dibuja el mapa de Türkiye y las líneas de falla en cuanto se le pide, conectando bien los filtros de ciudad y magnitud. Por el lado de DeepSeek el mapa apenas se parece al país; el resultado es 8,3 a 7,9.

En la prueba del sistema operativo en el navegador Gemini produce un escritorio colorido, un gestor de archivos funcional y un bloc de notas que realmente guarda. La configuración de DeepSeek sufre con colores pálidos, archivos que no se abren y notas que no se guardan; el propio autor dice que el problema puede ser el encaje con OpenCode más que el modelo. Gemini se lleva esta ronda con 8,2.

Al convertir el plano 2D en una casa 3D, ambos modelos montan paredes, etiquetas de habitaciones y controles de cámara. DeepSeek coloca muebles en direcciones y habitaciones equivocadas mientras que Gemini comete menos errores y añade extras como navegación habitación por habitación. Las puntuaciones van de 7,7 a 7,3, otra vez para Gemini.

El juego de granja final exige tiempo, oro, semillas, trabajadores y una economía de mercado en un solo prompt, y aquí la brecha se abre al máximo. Gemini transmite un juego real con una parcela de 3x3, una disposición ordenada y retroalimentación de compra-venta, mientras que DeepSeek se queda en una parcela de 2x2 con paneles superpuestos. La puntuación es 8,3 a 7,3.

El veredicto general del vídeo es claro: el autor, que al principio esperaba que ganara DeepSeek, acaba recomendando Gemini 3.8 Flash y sugiere probarlo con Antigravity. Una nota de precios para cerrar: DeepSeek es unas cinco veces más barato y de pesos abiertos; el movimiento más sano es verificar este panorama con dos ejecuciones breves sobre tu propia carga de trabajo, no solo con las puntuaciones del vídeo.

Visualization: nodesdaily AI

Comentario de la IA

""El ritmo del segmento flash me sorprende: Google lanzando tres versiones Flash en seis semanas por un lado, DeepSeek retirando modelos antiguos y consolidándose bajo un solo nombre por el otro. Elegí este vídeo por las grabaciones de pantalla de aplicaciones reales construidas con un solo prompt, más que por las tablas de puntuaciones; los números son el escaparate, la historia real está en pantalla. Aun así, nunca juzgaría con un solo vídeo, y la sección de evaluación explica por qué.""

Evaluación de la IA

Primero, el caso de la defensa: las puntuaciones oficiales de DeepSeek están en el nivel más alto también en ejecuciones independientes, su precio es un quinto del del rival, y los pesos abiertos con licencia MIT permiten ejecutar el modelo en tu propio hardware. Además, la prueba del vídeo se ejecutó, por admisión del propio autor, sobre un agente que DeepSeek no tolera bien; los mismos prompts podrían puntuar de forma distinta con otro agente.

En cuanto al método, el panorama es pobre: un solo intento, sin puntuación a ciegas, una muestra de cinco prompts, y el evaluador es dueño del vídeo. Existen piezas independientes que critican a los proveedores por ganar siempre en sus propias pruebas por una razón; más llamativo aún, se ha medido una brecha de 9 puntos entre la puntuación interna de DeepSeek en Terminal Bench y una ejecución independiente. Las gráficas oficiales son el escaparate; las decisiones pertenecen a las ejecuciones independientes.

Dos notas de fechas sobre verificabilidad: la tarifa de 0,75 $ y 3,75 $ de Gemini es una oferta de lanzamiento válida hasta fin de año, y DeepSeek acaba de salir de una beta por tiempo limitado. Los precios de GLM también cambian según el plan y la temporada, así que no guardes las cifras del vídeo sin comprobar las tarifas de hoy. Y recuerda: esto no es un informe de laboratorio, es la impresión práctica de un creador.

Mi conclusión: empieza con DeepSeek si el presupuesto y la autonomía de los datos van primero, prueba Gemini si buscas prototipos visuales y funcionales a partir de un solo prompt. No te decidas por ninguno por lo que diga un solo vídeo; dar a ambos modelos el mismo trabajo y comparar los resultados con tus propios ojos toma diez minutos y cuesta menos que cualquier suite de pruebas.

Fuentes

10 enlaces; 1 de ellos también citados por 2 otras noticias. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

deepseek · gemini · programación · benchmarks · rendimiento-precio · ia

Seguir el tema

Antes de esta noticia

Un breve orden de lectura de noticias anteriores vinculadas a este evento por un editor.

Evidencia y fuentes

Revisa los pasajes permitidos, sus versiones y su origen.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…

DeepSeek V4.1 Flash se enfrenta a Gemini 3.8 Flash