Retour au fil

Jour 228 : un Minecraft en 12 minutes, un modèle à 3 centimes et 233 000 $ d'ARR

Au jour 228 d'un marathon de vibe-coding visant un million de dollars, le streameur de BridgeMind a soumis le tout nouveau DeepSeek-V4.1-Flash à un test chronométré : une première exécution à trois centimes, un clone de Minecraft terminé en douze minutes, un compteur d'ARR passant de 232 000 $ à 233 000 $ en direct, et des projets d'assistant vocal. Je lis ce stream comme un enregistrement en direct de la tension entre une inférence bon marché et une orchestration coûteuse.

Importé dans Nodesdaily : (UTC+03:00)
Voir sur YouTube — ufmw2YoqBM8
Options de lecture

La lecture vocale n’est pas disponible dans ce navigateur.

Loupe à concepts

Choisissez un terme technique de cette vue pour lire sa définition générale, un exemple pédagogique et son usage dans l’article.

Aucun terme de notre glossaire n’a été trouvé dans cette vue. Le glossaire ne couvre pas encore tous les termes.

Le jour 228 a commencé avec deux chiffres au tableau : un objectif d'un million de dollars et 231 260 $ d'ARR. Le streameur ne cache rien et place ces chiffres dans le titre de chaque stream. Je pense que c'est tout l'attrait du format marathon : la progression se mesure devant tout le monde.

La première nouvelle du jour était tombée ce matin-là avec la sortie de DeepSeek-V4.1-Flash. Reuters a confirmé le lancement dans un reportage du 10 septembre, décrivant le modèle comme le plus petit membre d'une nouvelle famille d'architectures. Le streameur a lancé un minuteur et annoncé une heure de tests en direct.

L'émission s'est ouverte sur un tableau benchmax plaçant DeepSeek-V4.1-Flash à 74,2 points, devant Opus 5 et GPT-5.6 Sol. Le chat a plaisanté en disant que le benchmaxing devrait devenir une discipline notée. Je prends la plaisanterie au sérieux, parce que la partie qui montre le tableau nage dans le même écosystème que celle qui vend le modèle.

Le vrai test s'est déroulé sur Bridgebench. La première exécution s'est terminée en 3 minutes 28 secondes pour trois centimes, tandis que la même tâche a pris à GPT-6 Astra 3 minutes 54 secondes à environ vingt fois le prix. Le streameur a loué les reflets et la qualité du design, et le chat était d'accord.

J'ai croisé le récit tarifaire avec des sources web. Le stream citait 15 et 60 centimes par million de tokens, tandis que la presse tech rapporte que le modèle talonne ses rivaux à un coût environ 86 fois inférieur avec des besoins mémoire fortement réduits. L'étiquette Flash n'est pas un hasard : ce segment est celui où la vitesse rencontre le prix.

La configuration du test venait de la communauté. Un prompt Minecraft d'un spectateur nommé Isaac a été choisi, et le modèle a été chargé d'ouvrir un sous-répertoire et de construire le clone à l'intérieur. Les commandes sont parties en direct, sans couper les temps d'attente. C'est là que je trouve ce format honnête : les erreurs comme les réussites restent au dossier.

Le résultat a surpris tout le monde : le clone de Minecraft est apparu en environ douze minutes pour cinquante centimes de dépense totale. Le streameur l'a qualifié de meilleure sortie vue d'un modèle de gamme flash. Les tentatives Muse Spark 1.3 et Gemini 3.8 Flash ont été jugées faibles, même si le niveau Opus 5 et GPT-5.6 Sol restait hors de portée.

La comparaison ne s'est pas arrêtée là. Une ancienne version de Minecraft générée avec Muse 3 a été lancée dans Chrome pour une comparaison côte à côte. Le fait que l'ancienne version fonctionne encore soulève la question de la cohérence derrière les victoires en un seul essai.

Les lignes les plus dures du jour visaient le harness, pas le modèle. Le streameur a dit franchement qu'il n'aimait pas la configuration de test DeepSeek prête à l'emploi. Puis sont venues des plaintes sur l'incohérence et la lenteur, couronnées par un refus de laisser le modèle approcher sa vraie base de code. À mon avis, c'était le moment le plus honnête de la journée.

Une deuxième histoire se déroule du côté de Bridgebench : la version trois de la plateforme est presque prête. Avec le stream dépassant 44 000 vues en moins de deux heures, le streameur a soutenu que l'intérêt se convertirait en revenus une fois la nouvelle version livrée. L'outil de test et le contenu s'alimentent mutuellement.

D'autres essais ont comblé les creux : Sonnet a reçu un prompt sur le thème de la fusée et le test de la veille a été relancé. Le chat a débattu de la qualité du code, avec l'idée populaire que les tests visuels signalent la qualité. Je reste prudent : un bel écran n'est pas une architecture propre.

Le segment de comptabilité était remarquablement ouvert. Le streameur paie environ 1 300 $ par mois en abonnements IA. Un quota d'API de 15 000 $ fond vite, la facture AWS atteint 1 000 $ par mois, et la consommation quotidienne de tokens tourne entre un et deux milliards. C'est le coût invisible du marathon.

Côté produit, il y a eu un build iOS. L'équipe a ouvert le compte Apple pour l'application iPhone BridgeMind et a creusé un déploiement raté sur AWS Amplify. Se connecter aux comptes et déboguer en direct est devenu le geste signature de la culture du vibe-coding.

Le moment le plus commenté a été le compteur : l'ARR a franchi 232 000 $ pendant la diffusion et a poussé vers 233 000 $. Les chiffres du deuxième trimestre ont été révélés comme 70 000 $ de revenus contre 37 000 $ de résultat net, une marge supérieure à cinquante pour cent. Les revenus YouTube sont exclus du compteur, comme souligné à l'antenne.

L'objectif est tout aussi explicite : 300 000 $ avant la fin de septembre. Le streameur a affirmé que la base de soutiens sur X peut apporter 250 000 vues sur un seul post. La communauté fonctionne ici comme un canal marketing.

Le segment de l'assistant vocal a montré la direction du produit. Un mot de réveil pour le côté iOS et un prompt mains libres pour l'assistant de bureau ont été discutés. Le stack vocal actuel a été admis comme coûteux, avec des crédits utilisateurs qui se vident vite.

Les espoirs reposent sur GPT Live et les modèles vocaux temps réel. Le streameur n'a pas caché trouver les modèles temps réel actuels faibles, mais il a soutenu que la nouvelle sortie pourrait justifier de réécrire l'assistant. Une étude indépendante mesurant quatre mille sessions a trouvé des coûts par minute divergeant largement des estimations populaires, donc la tarification reste floue.

Les rituels font aussi partie du format : une application de chat combinant YouTube et Twitch, de la musique de grind en arrière-plan, des abonnements ChatGPT Pro offerts, et une lecture sponsorisée entre deux. Cela ressemble moins à du remplissage qu'à des mécaniques tenant la communauté ensemble.

J'ai vérifié les identités des modèles sur le web. La famille GPT-5.6 s'étend de Luna à Terra et Sol ; Opus 5 a été lancé en revendiquant une parité de codage à la moitié du prix d'un rival ; GPT-6 Astra est livré comme le vaisseau amiral d'OpenAI et est entré dans Copilot. Les noms dans le stream sont réels.

Les rivaux testés se vérifient aussi : Muse Spark 1.3 est l'annonce actuelle de Meta et Gemini 3.8 Flash est celle de Google. Le duel s'est donc déroulé contre le cycle d'actualité réel de cette semaine, ce qui augmente la valeur historique de la diffusion.

Ma carte des affirmations de supériorité ressemble à ceci : DeepSeek mène le tableau benchmax, domine le round prix-performance dans les essais visuels de Bridgebench, tandis qu'Opus 5 et Sol tiennent la ligne poids lourd sur la capacité générale. Trois critères différents, trois gagnants différents ; aucun tableau unique ne peut tout dire.

L'émission s'est terminée sur GPT Live avec 5.6 Luna. Le streameur a noté hautement la progression du jour et a laissé le reste pour demain. La conclusion a été rapide, le compteur restant près de 233 000 $.

Ma lecture globale : ce marathon de 228 jours cadre les deux rives de l'économie de l'IA en un seul plan. L'inférence ne cesse de devenir moins chère tandis que l'orchestration ne cesse de devenir plus chère ; le modèle arrive presque gratuitement et le travail qui le transforme en produit coûte une fortune.

Visualization: nodesdaily AI

Commentaire de l’IA

""À mes yeux, ce stream ressemblait moins à une revue de modèle qu'au grand livre ouvert d'une entreprise logicielle d'une seule personne. Les chiffres fusent, les tests s'exécutent en direct, le compteur grimpe devant tout le monde. Cette transparence est impressionnante ; mais, comme tout test en direct, elle brouille aussi la frontière entre applaudissements et preuves.""

Évaluation de l’IA

Je prends l'objection la plus forte au sérieux : dans l'essai de Composio rapporté par VentureBeat, un modèle DeepSeek en tête des classements n'a terminé que 53,8 pour cent des 30 tâches difficiles d'agents sur huit harnesses. Sur 240 exécutions, 129 ont réussi, et seulement six des 30 workflows se sont terminés dans chaque configuration. Ainsi, un gouffre sépare une démo à trois centimes avec un seul prompt d'un vrai travail d'agent, et l'orchestration décide du résultat plus que le modèle brut. Ce stream montre le côté amusant de ce gouffre.

Je vois trois lacunes dans la méthode. D'abord, les tests en direct sont des exécutions à essai unique sous pression temporelle, et l'excitation du chat infléchit le verdict. Ensuite, la dimension sécurité n'a pas été testée, alors que The Verge a rapporté un cas où un site codé en vibe-coding portait une faille d'injection SQL pendant des mois. Enfin, les taux élevés d'échec dans les tests de sécurité d'une ancienne version de DeepSeek ajoutent des raisons d'être prudent ; cette ancienne version n'est pas le modèle d'aujourd'hui, mais elle figure au dossier de la famille.

J'ai relevé quatre points d'interrogation sur la vérifiabilité. Les chiffres benchmax viennent du tableau du streameur lui-même, sans nouvelle exécution indépendante. Côté prix, VentureBeat rapporte que DeepSeek augmente les prix de V4, donc les trois centimes d'aujourd'hui pourraient ne pas être le tarif de demain. Les chiffres d'ARR et de profit reposent purement sur l'auto-déclaration. Je n'ai pas pu confirmer dans des sources indépendantes les détails d'architecture des paramètres cités à l'antenne, donc je ne les répète pas ici.

Mon verdict pratique est le suivant : pour des essais, des prototypes et des tests visuels dans le moule Bridgebench, j'essaierais moi-même des modèles de cette classe ; ils sont bon marché, rapides et amusants. Mais je ne leur confierais pas la base de code génératrice de revenus, les données clients ni les déploiements en production, et la propre ligne du streameur me guide en ce sens. Ce que 228 jours de ce marathon m'apprennent, c'est que le système gagne l'argent, pas le modèle.

Sources

12 liens ; 3 d’entre eux sont aussi cités par 21 autres articles. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

deepseek · vibe-coding · bridgemind · clone-minecraft · gpt-6-astra · assistant-vocal · arr

Suivre le sujet

Avant cet article

Un court ordre de lecture des articles antérieurs reliés à cet événement par un éditeur.

Preuves et sources

Consultez les passages autorisés, leurs versions et leur origine.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…