Volver al inicio

Día 228: un Minecraft en 12 minutos, un modelo de 3 centavos y 233 000 $ de ARR

En el día 228 de un maratón de vibe-coding que apunta a un millón de dólares, el streamer de BridgeMind sometió al recién lanzado DeepSeek-V4.1-Flash a una prueba cronometrada: una primera ejecución de tres centavos, un clon de Minecraft terminado en doce minutos, un contador de ARR subiendo de 232 000 $ a 233 000 $ en vivo, y planes de asistente de voz. Leo este stream como un registro en vivo de la tensión entre inferencia barata y orquestación cara.

Importado a Nodesdaily: (UTC+03:00)
Ver en YouTube — ufmw2YoqBM8
Opciones de lectura

La voz del dispositivo no está disponible en este navegador.

Lupa de conceptos

Elige un término técnico de esta vista para leer su definición general, un ejemplo didáctico y su uso en el artículo.

No se encontró ningún término de nuestro glosario en esta vista. El glosario aún no cubre todos los términos.

El día 228 comenzó con dos cifras en la pizarra: un objetivo de un millón de dólares y 231 260 $ de ARR. El streamer no oculta nada y coloca las cifras en el título de cada stream. Creo que ese es todo el atractivo del formato maratón: el progreso se mide delante de todos.

La primera noticia del día llegó esa mañana con el lanzamiento de DeepSeek-V4.1-Flash. Reuters confirmó el lanzamiento en un informe del 10 de septiembre, describiendo el modelo como el miembro más pequeño de una nueva familia de arquitecturas. El streamer puso un temporizador y anunció una hora de pruebas en vivo.

El programa abrió con una tabla benchmax que situaba a DeepSeek-V4.1-Flash en 74,2 puntos, por delante de Opus 5 y GPT-5.6 Sol. El chat bromeó con que el benchmaxing debería convertirse en una disciplina puntuable. Me tomo la broma en serio, porque la parte que muestra la tabla nada en el mismo ecosistema que la parte que vende el modelo.

La prueba real se ejecutó en Bridgebench. La primera ejecución terminó en 3 minutos 28 segundos por tres centavos, mientras que la misma tarea llevó a GPT-6 Astra 3 minutos 54 segundos a aproximadamente veinte veces el precio. El streamer elogió los reflejos y la calidad del diseño, y el chat estuvo de acuerdo.

Contrasté el relato de precios con fuentes web. El stream citaba 15 y 60 centavos por millón de tokens, mientras que la prensa tecnológica informa que el modelo compite con sus rivales a un costo aproximadamente 86 veces menor con necesidades de memoria muy reducidas. La etiqueta Flash no es casualidad: este segmento es donde la velocidad se encuentra con el precio.

La configuración de la prueba vino de la comunidad. Se eligió un prompt de Minecraft de un espectador llamado Isaac, y se le dijo al modelo que abriera un subdirectorio y construyera el clon dentro de él. Los comandos salieron en vivo con los tiempos de espera sin recortar. Ahí encuentro honesto este formato: los errores y los aciertos quedan registrados.

El resultado sorprendió a todos: el clon de Minecraft apareció en unos doce minutos por cincuenta centavos de gasto total. El streamer lo llamó la mejor salida vista de un modelo de gama flash. Los intentos de Muse Spark 1.3 y Gemini 3.8 Flash fueron juzgados débiles, aunque el nivel de Opus 5 y GPT-5.6 Sol seguía fuera de alcance.

La comparación no se detuvo ahí. Una versión anterior de Minecraft generada con Muse 3 se lanzó en Chrome para una comparación lado a lado. El hecho de que la versión anterior siga funcionando plantea la pregunta de la consistencia detrás de victorias de un solo intento.

Las líneas más duras del día apuntaron al harness, no al modelo. El streamer dijo claramente que no le gustaba la configuración de prueba lista para usar de DeepSeek. Luego vinieron quejas sobre inconsistencia y lentitud, rematadas con una negativa a dejar que el modelo se acercara a su base de código real. Ese fue el momento más honesto del día, en mi opinión.

Una segunda historia corre por el lado de Bridgebench: la versión tres de la plataforma está casi lista. Con el stream superando 44 000 vistas en menos de dos horas, el streamer argumentó que el interés se convertiría en ingresos una vez que se lance la nueva versión. La herramienta de prueba y el contenido se retroalimentan.

Más pruebas llenaron los huecos: Sonnet recibió un prompt con tema de cohete y la prueba de ayer se volvió a ejecutar. El chat debatió sobre la calidad del código, con la opinión popular de que las pruebas visuales señalan calidad. Yo me mantengo cauteloso: una pantalla bonita no es una arquitectura limpia.

El segmento de contabilidad fue notablemente abierto. El streamer paga unos 1 300 $ al mes en suscripciones de IA. Una cuota de API de 15 000 $ se derrite rápido, la factura de AWS llega a 1 000 $ al mes, y el consumo diario de tokens oscila entre uno y dos mil millones. Ese es el costo invisible del maratón.

En el frente de producto hubo una compilación iOS. El equipo abrió la cuenta de Apple para la aplicación iPhone de BridgeMind y se metió en un despliegue fallido en AWS Amplify. Iniciar sesión en cuentas y depurar en vivo se ha convertido en el movimiento característico de la cultura del vibe-coding.

El momento más comentado fue el contador: el ARR superó 232 000 $ durante la transmisión y empujó hacia 233 000 $. Las cifras del segundo trimestre se revelaron como 70 000 $ de ingresos frente a 37 000 $ de beneficio neto, un margen superior al cincuenta por ciento. Los ingresos de YouTube se excluyen del contador, como se subrayó en el aire.

El objetivo es igual de explícito: 300 000 $ antes de que termine septiembre. El streamer afirmó que la base de seguidores en X puede generar 250 000 vistas en una sola publicación. La comunidad funciona aquí como un canal de marketing.

El segmento del asistente de voz mostró hacia dónde va el producto. Se discutieron una palabra de activación para el lado iOS y prompts sin manos para el asistente de escritorio. Se admitió que el stack de voz actual es caro, con créditos de usuario que se agotan rápido.

Las esperanzas descansan en GPT Live y los modelos de voz en tiempo real. El streamer no ocultó encontrar débiles los modelos en tiempo real actuales, pero argumentó que el nuevo lanzamiento podría justificar reescribir el asistente. Un estudio independiente que midió cuatro mil sesiones encontró costos por minuto que divergen ampliamente de las estimaciones populares, por lo que el precio sigue siendo nebuloso.

Los rituales también son parte del formato: una aplicación de chat que combina YouTube y Twitch, música de grind de fondo, suscripciones a ChatGPT Pro regaladas y una lectura de patrocinador en medio. Esto se lee menos como relleno y más como mecanismos que mantienen unida a la comunidad.

Verifiqué las identidades de los modelos en la web. La familia GPT-5.6 abarca Luna, Terra y Sol; Opus 5 se lanzó alegando paridad de codificación a la mitad del precio de un rival; GPT-6 Astra se envía como el buque insignia de OpenAI y ha entrado en Copilot. Los nombres en el stream son reales.

Los rivales de prueba también se verifican: Muse Spark 1.3 es el anuncio actual de Meta y Gemini 3.8 Flash es el de Google. Así que el duelo se corrió contra el ciclo de noticias real de esa semana, lo que eleva el valor histórico de la transmisión.

Mi mapa de las afirmaciones de 'mejor que' se ve así: DeepSeek lidera la tabla benchmax, domina la ronda de precio-rendimiento en pruebas visuales de Bridgebench, mientras que Opus 5 y Sol sostienen la línea de peso pesado en capacidad general. Tres varas de medir diferentes, tres ganadores diferentes; ninguna tabla única puede decirlo todo.

El programa cerró con GPT Live con 5.6 Luna. El streamer calificó alto el progreso del día y dejó el resto para mañana. La despedida fue rápida, con el contador cerca de 233 000 $.

Mi lectura general: este maratón de 228 días enmarca ambas orillas de la economía de la IA en una sola toma. La inferencia sigue abaratándose mientras la orquestación sigue encareciéndose; el modelo llega casi gratis y el trabajo que lo convierte en producto cuesta una fortuna.

Visualization: nodesdaily AI

Comentario de la IA

""A mis ojos, este stream se sintió menos como una reseña de un modelo y más como el libro abierto de un negocio de software de una sola persona. Los números vuelan, las pruebas se ejecutan en vivo, el contador sube frente a todos. Esa transparencia es impresionante; pero, como toda prueba en vivo, también difumina la línea entre aplausos y evidencia.""

Evaluación de la IA

Me tomo en serio la objeción más fuerte: en el ensayo de Composio reportado por VentureBeat, un modelo DeepSeek líder de rankings terminó solo el 53,8 por ciento de 30 tareas difíciles de agentes en ocho harnesses. De 240 ejecuciones, 129 pasaron, y solo seis de los 30 flujos de trabajo se completaron en cada configuración. Así, un abismo separa una demo de tres centavos con un solo prompt del trabajo real de agentes, y la orquestación decide el resultado más que el modelo bruto. Este stream muestra el lado divertido de ese abismo.

Veo tres brechas en el método. Primero, las pruebas en vivo son ejecuciones de un solo intento bajo presión de tiempo, y la emoción del chat tuerce el veredicto. Segundo, la dimensión de seguridad no se probó, aunque The Verge reportó un caso en el que un sitio vibe-coded llevaba una vulnerabilidad de inyección SQL durante meses. Tercero, las altas tasas de fracaso en pruebas de seguridad de una versión anterior de DeepSeek añaden razones para la cautela; esa versión anterior no es el modelo de hoy, pero figura en el expediente de la familia.

Anoté cuatro interrogantes sobre la verificabilidad. Las cifras de benchmax provienen de la tabla del propio streamer, sin una nueva ejecución independiente. En precios, VentureBeat informa que DeepSeek está subiendo los precios de V4, así que los tres centavos de hoy pueden no ser la tarifa de mañana. Las cifras de ARR y beneficio descansan puramente en el autoinforme. No pude confirmar en fuentes independientes los detalles de arquitectura de parámetros citados en el aire, así que no los repito aquí.

Mi veredicto práctico es este: para ensayos, prototipos y pruebas visuales en el molde de Bridgebench, yo mismo probaría modelos de esta clase; son baratos, rápidos y divertidos. Pero no les confiaría la base de código que genera ingresos, los datos de clientes ni los despliegues de producción, y la propia línea del streamer me guía ahí. Lo que 228 días de este maratón me enseñan es que el sistema gana el dinero, no el modelo.

Fuentes

12 enlaces; 3 de ellos también citados por 21 otras noticias. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

deepseek · vibe-coding · bridgemind · clon-minecraft · gpt-6-astra · asistente-vocal · arr

Seguir el tema

Antes de esta noticia

Un breve orden de lectura de noticias anteriores vinculadas a este evento por un editor.

Evidencia y fuentes

Revisa los pasajes permitidos, sus versiones y su origen.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…