Retour au fil

DeepSeek V4.1 Flash : Bon marché, rapide et ouvert — mais imparfait sur le banc d'essai

Le 10 septembre, DeepSeek a lancé V4.1 Flash, un modèle à poids ouverts de 552 milliards de paramètres avec un contexte d'un million de jetons, une licence MIT et des scores de référence qui défient les géants fermés. Les tests pratiques de Matthew Berman révèlent le côté plus rugueux de l'histoire.

Importé dans Nodesdaily : (UTC+03:00)
Voir sur YouTube — U-rsvXds9ck
Options de lecture

La lecture vocale n’est pas disponible dans ce navigateur.

Loupe à concepts

Choisissez un terme technique de cette vue pour lire sa définition générale, un exemple pédagogique et son usage dans l’article.

Aucun terme de notre glossaire n’a été trouvé dans cette vue. Le glossaire ne couvre pas encore tous les termes.

DeepSeek a officiellement lancé V4.1 Flash le 10 septembre : un modèle de 552 milliards de paramètres avec un contexte d'un million de jetons et des poids ouverts sous licence MIT. Via l'API, il répond à deepseek-flash, et les anciens noms v4-flash y sont désormais acheminés. L'affirmation principale est audacieuse : les scores se situent dans la même ligue que les géants fermés de la génération précédente, Opus 5 et GPT-5.6 Sol. La vidéo inscrit cela dans un rythme familier de six mois : la frontière sprinte d'abord, les modèles ouverts atteignent ce niveau six mois plus tard, et six mois après cela, la puissance arrive sur les machines locales.

Le tableau de bord publié présente des points forts clairs : 74,2 sur DeepSWE v1.1 pour l'ingénierie logicielle, un cheveu au-dessus d'Opus 5 à 74,0 ; 88,1 sur CyberGym pour la sécurité ; 54,8 sur AutomationBench. Le tableau a cependant ses limites : sur Terminal-Bench 3.0, il s'arrête à 30,0, bien derrière Opus 5 à 43,3. Et dans un domaine de conception tiers, il atteint 98 % du score d'Astra tout en dépensant environ 2,3 cents par tâche ; Astra facture 1,61 $ pour le même travail.

L'architecture est la partie la plus intéressante. Le modèle utilise un nouveau squelette encodeur-décodeur à 40 couches : 20 couches lisent l'entrée, 20 produisent la sortie. La lecture n'active que 8 milliards de paramètres par jeton, la génération 16 milliards ; le reste des 552 milliards reste inactif à ce moment-là. C'est l'idée du mélange d'experts en un mot : décider quel mini-spécialiste possède la question et la lui confier. Un mécanisme d'attention clairsemée compressée réduit encore les coûts des textes longs.

La vidéo teste en direct l'affirmation de vitesse : un échantillon de mille mots est diffusé en environ six secondes, soit de l'ordre de 200 jetons par seconde. L'hôte compare la sensation à l'excitation des débuts de Groq, et note que le modèle surpasse le précédent fleuron V4 Pro. Pour les charges de travail d'agents qui continuent à lire de nouvelles entrées, ce tempo peut être plus important que n'importe quel score brut, car le temps d'attente est facturé tout comme le calcul.

Le gain de mémoire est encore plus frappant. Le cache de contexte occupe environ un quart de la mémoire rapide et un huitième de l'espace SSD dont son prédécesseur avait besoin. La comparaison de l'entreprise avec V1 est étonnante : le cache par jeton a été réduit de 437 fois. Pour les agents qui traitent de longs contextes étape par étape, cela signifie moins de mémoire GPU utilisée et une facture de serveur plus petite.

Cette évolution intervient au milieu d'une véritable crise. Les prix spot de la HBM3E seraient quatre à cinq fois supérieurs aux niveaux des contrats à long terme, Samsung bloquant 70 % de la capacité jusqu'en 2031. Le 10 septembre, Reuters a rapporté que les fabricants de puces chinois augmentaient les prix des processeurs alors que l'inflation de la mémoire mordait. Des téléphones et des ordinateurs plus chers avec une mémoire réduite sont la fumée du même feu ; DeepSeek cherche la réponse dans les algorithmes.

La liste de prix est agressive : 15 cents par million de jetons d'entrée en heures creuses, 30 cents en heures de pointe. L'entrée mise en cache est presque gratuite à 0,3 cent par million. La sortie varie entre 60 cents et 1,20 $ par million. Le double tarif existe pour attirer les charges de travail des entreprises pendant les heures où les GPU sont inactifs. Et comme les poids sont ouverts, personne n'a à confier ses données à DeepSeek.

La thèse économique de la vidéo est claire : le prix de la meilleure réponse et le prix d'une réponse "suffisamment bonne" diffèrent par des ordres de grandeur, la frontière fermée facturant de l'ordre de 50 $ par million de jetons tandis que cette catégorie parle en cents. Pour les travaux à grand volume comme les sites web et les pipelines PDF, que l'hôte estime à 95 % de l'utilisation, ce niveau est plus que capable. L'entreprise documente même ses techniques dans un rapport ouvert sur lequel une startup pourrait s'appuyer.

Le banc d'essai est moins généreux que le tableau de bord. La simulation du Rubik's cube s'écrit en 12 secondes et semble correcte à première vue, mais appuyer sur "mélanger" fait changer les couleurs d'elles-mêmes plutôt que par mouvement. Le bouton de résolution ne produit aucune solution réelle ; il rejoue les mouvements à l'envers jusqu'au début. Le même échec apparaît sur le site de l'entreprise et via Codex, et l'hôte dit qu'aucun modèle n'a échoué à ce test depuis un an et demi.

Deux autres essais suivent. Dans l'exercice Paintbench de l'équipe, le modèle transforme un portrait de référence en une œuvre abstraite, manquant de détails, sans le travail de pinceau en couches d'Astra. La démo 3D "balle traversant l'eau" est livrée dans une belle coquille d'application avec une physique médiocre. Le verdict est juste : un cheval de bataille bon marché, rapide et efficace ; savoir s'il bat GLM 5.3 est une question pour une autre vidéo.

Visualization: nodesdaily AI

Commentaire de l’IA

"« Mon interprétation : cette version prouve que les modèles ouverts maintiennent leur rythme de six mois de retard ; la vraie nouvelle n'est pas le tableau de référence mais l'architecture qui réduit la facture de mémoire. Le fiasco du Rubik's cube marque honnêtement les limites de cette catégorie. »"

Évaluation de l’IA

D'abord l'acier : ces scores proviennent du propre rapport de l'entreprise. Le jour du lancement, aucune mesure indépendante n'existait ; Artificial Analysis n'avait pas testé le modèle et sa page Hugging Face ne montrait aucun fournisseur de services. Sur des tableaux comme Terminal-Bench 3.0, Opus 5 mène avec une large marge. Le verdict de "niveau frontière" repose donc sur des tableaux de bord sélectionnés et doit être lu comme une affirmation non vérifiée.

Les propres essais de la vidéo sont des démonstrations à une seule invite, à une seule tentative ; ils n'ont aucune valeur statistique. Plus important encore, l'entreprise fixe elle-même les limites : sur les tâches d'agent les plus difficiles à saveur scientifique et sur l'analyse d'images, l'écart avec les modèles géants persiste. Un score faible comme 15 sur Exploit Gym est le coin balayé du tableau. L'effondrement des tests de jeu peut être un signal précoce de ces limites.

Deux mises en garde sur la vérifiabilité. Premièrement, le suffixe « .1 » suggère une mise au point, mais en dessous se trouve un tout nouveau modèle de base tandis qu'un fleuron de 1,6 billion de paramètres prend sa retraite. Deuxièmement, les prix brillent le plus aux tarifs hors pointe. Avant de décider, je testerais ma propre charge de travail aux prix de pointe et par rapport à des mesures indépendantes.

Ma pratique se présente comme suit : pour les tâches d'agent à long contexte et les configurations à mémoire limitée, ce modèle est le premier candidat à essayer ; là où la précision finale est achetée avec de l'argent, la frontière fermée règne toujours. Je ferai confiance à mes propres mesures plutôt qu'au prix, et les poids ouverts rendent cette mesure sans risque.

Sources

10 liens ; 5 d’entre eux sont aussi cités par 5 autres articles. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

deepseek · v4.1 flash · poids ouverts · moe · benchmarks · hbm · ia

Suivre le sujet

Avant cet article

Un court ordre de lecture des articles antérieurs reliés à cet événement par un éditeur.

Preuves et sources

Consultez les passages autorisés, leurs versions et leur origine.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…