Retour au fil

DeepSeek V4.1 Flash prend la relève du Pro : une conception asymétrique entre dans la course aux agents de pointe

DeepSeek redirige le trafic Pro vers le nouveau V4.1 Flash en attendant le prochain Pro, associant une conception asymétrique de 8 milliards de paramètres en lecture / 16 milliards en écriture à un cache et des tableaux de référence nettement plus réduits, avant Claude Opus 5 et GPT-5.6 Sol.

Importé dans Nodesdaily : (UTC+03:00)
Voir sur YouTube — tQ2T__1XfVU
Options de lecture

La lecture vocale n’est pas disponible dans ce navigateur.

Loupe à concepts

Choisissez un terme technique de cette vue pour lire sa définition générale, un exemple pédagogique et son usage dans l’article.

Aucun terme de notre glossaire n’a été trouvé dans cette vue. Le glossaire ne couvre pas encore tous les termes.

DeepSeek a enfreint une règle non écrite avec cette version : le modèle baptisé Flash prend temporairement en charge le travail qui revenait autrefois au modèle phare Pro. À partir de 04h00 UTC le 14 septembre 2026, les requêtes Pro sont routées vers V4.1 Flash aux tarifs Flash, jusqu'à l'arrivée du prochain modèle Pro. Ce n'est pas une option secondaire pour le trafic à bas coût ; c'est la ligne principale qui porte temporairement le badge Flash.

L'ancienne hiérarchie était simple. V4 Pro était le poids lourd avec 1 600 milliards de paramètres dont 49 milliards actifs par token, le modèle que l'on choisissait pour une puissance maximale. V4.1 Flash arrive avec une architecture de 552 milliards de paramètres, plus petite mais néanmoins colossale. Le titre de la nouvelle n'est donc pas le nombre de paramètres, mais la proportion du modèle qui s'active à chaque étape du travail.

L'idée centrale est un découpage asymétrique de type encodeur-décodeur causal. En gros, la lecture et l'écriture sont confiées à des équipes différentes : environ 8 milliards de paramètres actifs organisent le prompt, la base de code et les sorties des outils pendant la lecture, puis environ 16 milliards prennent le relais lorsque le modèle rédige les réponses et choisit le prochain appel d'outil. L'image mentale est celle d'une équipe qui trie un dossier immense et transmet les éléments distillés à une équipe plus forte qui rédige le plan.

La mémoire, c'est là que la conception se rentabilise. Les longues exécutions d'agents accumulent un historique croissant de contexte traité, et le transport de cet historique devient coûteux à mesure que les fenêtres s'étirent vers un million de tokens. DeepSeek annonce environ 890 octets de cache global par token, soit environ un quart de la génération précédente en mémoire active et un huitième en stockage persistant. Un cache plus réduit signifie moins de mémoire à haute bande passante par exécution active, moins de SSD par session stockée et moins de travail répété lorsque l'agent revient sur du matériel antérieur.

Viennent ensuite les tableaux. Sur Terminal-Bench 2.1, la vidéo rapporte 90,6 pour Flash contre 89,1 pour Claude Opus 5 et 88,8 pour GPT-5.6 Sol ; sur DeepSWE, elle rapporte 74,2 contre 74,0 et 73,0 ; sur AutomationBench, l'écart se creuse à 54,8 contre 50,3 et 45,8. Les premiers échos indépendants ajoutent de la nuance : un indice d'intelligence attribue à Flash 40 points, devant son propre Pro à 36, avec des rivaux nationaux encore plus hauts, et un test d'arène de conception le place à un point et demi d'un modèle fermé bien plus cher, pour une fraction du coût par design achevé.

Le modèle ne travaille pas seul, et c'est pourquoi la mise à jour du Harness compte. DeepSeek présente le Harness comme tout ce qui entoure le cerveau : outils, fichiers, accès au shell, planification, sous-agents, sessions, stockage, ordonnancement. La nouvelle version conserve le contexte coûteux lorsque les instructions système changent en cours de tâche, expose plus clairement les statistiques de hits de cache et de tokens, et rafraîchit les runtimes optionnels des sous-agents. La version 0.1.5 mise aussi sur l'import de fichiers et les aperçus latéraux, faisant évoluer le Harness d'un simple exécuteur vers un véritable atelier de travail quotidien.

Les poids ouverts sous licence MIT complètent le tableau, avec une réserve que la vidéo énonce clairement. Les développeurs gagnent l'inspection, des piles d'inférence prises en charge et l'affranchissement d'une API fermée unique, mais l'architecture complète doit toujours résider quelque part, bien au-delà d'un ordinateur portable standard. La décision se divise donc en trois : les bâtisseurs d'API obtiennent un lecteur moins cher pour les longs agents, les équipes d'infrastructure obtiennent le contrôle au prix d'un matériel sérieux, et quiconque cherche un champion unique pour toutes les tâches obtient la preuve d'une appartenance à la conversation de pointe plutôt que la preuve d'une couronne. La thèse de cette version est l'asymétrie : être économique là où la lecture le permet, et puissant là où la décision l'exige.

Visualization: nodesdaily AI

Commentaire de l’IA

"« Mon analyse : le geste intéressant ici n'est pas un score plus élevé, c'est une lecture moins coûteuse. Si les longues exécutions d'agents consistent surtout à gérer le contexte, dépenser moins pour lire et plus pour décider est la bonne asymétrie — mais je ne routerai le trafic de production qu'après que des réexécutions indépendantes auront confirmé les tableaux du fournisseur. »"

Évaluation de l’IA

L'objection la plus forte s'écrit toute seule : ce sont des tableaux publiés par le fournisseur pour justifier la mise à la retraite d'un modèle phare, et le même checkpoint serait censé s'étendre de 65,5 à 74,2 pour cent sur DeepSWE selon le harnais qui l'entoure. Les signaux indépendants sont pour l'instant mitigés : un indice place Flash à 40 points devant son propre Pro à 36, mais derrière deux rivaux nationaux, tandis que d'autres comptes rendus relèvent des faiblesses sur les ensembles de type programmation et à forte dominante scientifique. Cela ne rend pas la version vide de sens, mais cela rend les scores titanesques provisoires plutôt qu'établis.

Ce que la vidéo ne teste pas compte aussi : la stabilité à long terme sur des dépôts chaotiques, le comportement face à des instructions changeantes en cours de tâche pendant des heures, la facturation réelle en heures de pointe contre heures creuses pour des agents soutenus, et les données de revue de sécurité. La mise à jour du Harness répond en partie à cela avec des changements d'instructions préservant le cache et de meilleures statistiques de cache, mais la visibilité des statistiques ne vaut pas un mois mesuré d'incidents de production. Je voudrais aussi des chiffres de mémoire et de stockage issus d'un déploiement neutre, et pas seulement les ratios d'un quart en mémoire et d'un huitième en stockage du matériel de lancement.

La provenance façonne ma lecture de chaque chiffre. DeepSeek a publié les victoires tout en annonçant que les requêtes Pro passent aux tarifs Flash jusqu'à l'arrivée du prochain Pro, avec des partenaires déjà alignés derrière le nouveau modèle. Ma liste de vérification avant toute migration est donc courte : réexécuter Terminal-Bench sous une version fixe du harnais, comparer l'indice d'intelligence indépendant plutôt qu'un seul tableau du fournisseur, confirmer les prix réels des fournisseurs pour les créneaux de pointe et de creux, et lire les notes de version du Harness plutôt que la prose du lancement. Les chiffres qui survivent à cette épreuve méritent du trafic ; les autres restent des diapositives.

Mon avis pratique est triple. Si vous construisez des agents de code, Flash mérite un essai contrôlé, car la structure de coûts de la lecture plus le cache change l'économie unitaire des longues exécutions. Si vous voulez auto-héberger, la licence MIT donne le contrôle, mais l'architecture de 552 milliards de paramètres exige toujours un matériel d'accélération sérieux : le contrôle est réel, mais ce n'est pas bon marché. Et si vous voulez un modèle le plus fort pour tout, cette version ne tranche pas la question ; elle vaut à Flash une place à la table des agents de pointe, ni plus ni moins.

Sources

9 liens ; 3 d’entre eux sont aussi cités par 4 autres articles. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

deepseek · v4.1 flash · agents de code · benchmarks · poids ouverts · harness

Suivre le sujet

Avant cet article

Un court ordre de lecture des articles antérieurs reliés à cet événement par un éditeur.

Preuves et sources

Consultez les passages autorisés, leurs versions et leur origine.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…

DeepSeek V4.1 Flash prend la relève du Pro | Nodesdaily