La première quinzaine de septembre a vu deux lancements dans le segment flash : Google a annoncé Gemini 3.8 Flash accompagné d'une variante Cyber axée sur la sécurité le 2 septembre, tandis que DeepSeek a publié V4.1 Flash le 10 septembre et retiré les versions flash précédentes. La vidéo d'Ömer Göçmen se situe exactement à cette intersection, cherchant à répondre à la question de savoir lequel de ces deux modèles apparemment équivalents est le meilleur choix pour le travail quotidien, à travers cinq tests appliqués.
D'abord, le tableau de scores officiel : selon la documentation API de DeepSeek, V4.1 Flash obtient 82,7 sur Terminal Bench 2.1, 54,4 sur DeepSWE, 76,7 sur Cybergym et 70,3 sur Toolathlon ; le modèle est arrivé en bêta multimodale à durée limitée et s'appelle deepseek-flash sur l'API. La lecture des graphiques dans la vidéo confirme ce tableau : le modèle semble devant ses rivaux à poids ouverts tout en se plaçant légèrement en dessous du niveau des modèles phares.
L'histoire de l'architecture est familière : dans la conception en mélange d'experts de 552 milliards de paramètres, seuls environ 8 milliards de paramètres actifs par token travaillent sur chaque prompt plutôt que tout le réseau, et la vitesse vient de là. La tarification comporte trois niveaux : DeepSeek facture 0,15 $ en entrée et 0,60 $ en sortie par million de tokens, Gemini 3.8 Flash facture 0,75 $ et 3,75 $, et la place la plus chère du tableau de la vidéo revient à GLM avec 1,40 $ et 4,40 $. Le tarif de Gemini est une offre de lancement valable jusqu'à la fin de l'année, donc l'écart actuel ne durera peut-être pas.
Le dispositif de test se compose de cinq applications : un parc d'attractions en 3D, une application de données sismiques, un système d'exploitation dans le navigateur, une conversion d'un plan 2D en maison 3D et un jeu de ferme. DeepSeek tourne via OpenCode Go en réglage élevé, Gemini via sa propre infrastructure de service, et chaque test est noté sur 10. À noter que le correcteur est l'auteur de la vidéo lui-même ; je reviens sur les limites de cette méthode dans la section évaluation.
Dans le test du parc d'attractions, les deux modèles construisent des modes jour, visite et festival ; la grande roue et les montagnes russes obligatoires apparaissent chez les deux. L'écart se creuse dans les détails : Gemini ajoute une caméra embarquée au train, glisse des feux d'artifice non demandés en mode festival et affiche des transitions physiques plus fluides. DeepSeek obéit au prompt à la lettre mais ne va jamais une lettre au-delà ; les scores se lisent 8,5 contre 7,8.
Dans l'application sismique, les cartes statistiques sont correctes des deux côtés ; c'est la carte qui tranche. Gemini dessine la carte de la Türkiye et les lignes de faille dès qu'on le lui demande, en câblant correctement les filtres ville et magnitude. Côté DeepSeek, la carte ressemble à peine au pays ; le résultat est 8,3 contre 7,9.
Dans le test du système d'exploitation dans le navigateur, Gemini produit un bureau coloré, un gestionnaire de fichiers fonctionnel et un bloc-notes qui sauvegarde réellement. La configuration DeepSeek peine avec des couleurs pâles, des fichiers qui ne s'ouvrent pas et des notes qui ne s'enregistrent pas ; l'auteur lui-même dit que le problème vient peut-être de l'adaptation à OpenCode plutôt que du modèle. Gemini remporte cette manche avec 8,2.
Pour la conversion du plan 2D en maison 3D, les deux modèles mettent en place murs, étiquettes de pièces et contrôles de caméra. DeepSeek place les meubles dans de mauvaises directions et de mauvaises pièces tandis que Gemini commet moins d'erreurs et ajoute des extras comme une navigation pièce par pièce. Les scores vont de 7,7 à 7,3, encore pour Gemini.
Le jeu de ferme final exige du temps, de l'or, des graines, des ouvriers et une économie de marché en un seul prompt, et c'est ici que l'écart se creuse le plus. Gemini livre un vrai jeu avec une parcelle 3x3, une disposition soignée et un retour d'achat-vente, tandis que DeepSeek reste sur une parcelle 2x2 avec des panneaux qui se chevauchent. Le score est de 8,3 contre 7,3.
Le verdict global de la vidéo est clair : l'auteur, qui s'attendait au départ à une victoire de DeepSeek, finit par recommander Gemini 3.8 Flash et suggère de l'essayer avec Antigravity. Une note tarifaire pour finir : DeepSeek est environ cinq fois moins cher et à poids ouverts ; le geste le plus sain est de vérifier ce tableau avec deux courts essais sur votre propre charge de travail, et pas seulement avec les scores de la vidéo.
Commentaire de l’IA
""Le rythme du segment flash me surprend : Google qui livre trois versions Flash en six semaines d'un côté, DeepSeek qui retire ses anciens modèles et se consolide sous un seul nom de l'autre. J'ai choisi cette vidéo pour les captures d'écran de véritables applications construites en un seul prompt plutôt que pour les tableaux de scores ; les chiffres sont la vitrine, la vraie histoire est à l'écran. Cela dit, je ne jugerais jamais sur une seule vidéo, et la section évaluation explique pourquoi.""
Évaluation de l’IA
D'abord, les arguments à la décharge : les scores officiels de DeepSeek se situent dans le haut du tableau lors de tests indépendants également, son prix représente un cinquième de celui du rival, et les poids ouverts sous licence MIT permettent de faire tourner le modèle sur votre propre matériel. De plus, le test de la vidéo a tourné, de l'aveu de l'auteur, sur un agent que DeepSeek n'apprécie pas ; les mêmes prompts pourraient obtenir des scores différents sous un autre agent.
Côté méthode, l'image est mince : une seule tentative, pas de notation en aveugle, un échantillon de cinq prompts, et le correcteur est propriétaire de la vidéo. Des articles indépendants critiquant les fournisseurs pour toujours gagner leurs propres tests existent pour une raison ; plus frappant encore, un écart de 9 points a été mesuré entre le score interne de DeepSeek sur Terminal Bench et un test indépendant. Les graphiques officiels sont la vitrine ; les décisions appartiennent aux tests indépendants.
Deux notes de dates sur la vérifiabilité : le tarif de 0,75 $ et 3,75 $ de Gemini est une offre de lancement valable jusqu'à la fin de l'année, et DeepSeek sort tout juste d'une bêta à durée limitée. Les prix de GLM varient aussi selon le plan et la saison, donc n'encaissez pas les chiffres de la vidéo sans vérifier les tarifs du jour. Et rappelez-vous : ce n'est pas un rapport de laboratoire, c'est l'impression d'un créateur qui a testé en conditions réelles.
Mon avis : commencez par DeepSeek si le budget et l'autonomie des données passent en premier, essayez Gemini si vous cherchez des prototypes visuels et fonctionnels à partir d'un seul prompt. Ne vous engagez sur aucun des deux sur la foi d'une seule vidéo ; donner le même travail aux deux modèles et comparer les résultats de vos propres yeux prend dix minutes et coûte moins cher que n'importe quelle suite de tests.
Sources
10 liens ; 1 d’entre eux sont aussi cités par 2 autres articles. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
- @youtube https://www.youtube.com/watch?v=kUOhikNvG9o
- @api-docs https://api-docs.deepseek.com/updates
- @openrouter https://openrouter.ai/compare/deepseek/deepseek-v4.1-flash/google/gemini-3.8-flash
- @datacamp https://www.datacamp.com/blog/gemini-3-8-flash-cyber
- @blog https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber
Également cité par : Gemini Managed Agents 09-2026 Leap: Anti-Gravity on Gemini 3.8 Flash Finally Works Like a Real Teammate · The costume on Arena: Gemini 4 traces leaking under the Gemini 3.8 Flash label
- @felloai https://felloai.com/glm-pricing
- @youtube https://www.youtube.com/watch?v=nLzGTyo2aWg
- @datacamp https://www.datacamp.com/blog/deepseek-v4-1-flash
- @deepsource https://deepsource.com/blog/ai-code-review-benchmarks
- @youtube https://www.youtube.com/watch?v=IEjylUYFLf4
deepseek · gemini · programmation · benchmarks · rapport qualité-prix · ia