Retour au fil

DeepSeek V4.1 Flash et le cerveau divisé : défier les modèles de pointe avec des notes de 890 octets

Sorti le 10 septembre 2026, DeepSeek V4.1 Flash montre comment une petite équipe aux ressources limitées peut étendre un contexte d'un million de jetons avec une courbe de coût presque plate grâce à une architecture divisée ; la vidéo décortique ce bond d'efficacité pièce par pièce.

Importé dans Nodesdaily : (UTC+03:00)
Voir sur YouTube — MImgH4KMtj8
Options de lecture

La lecture vocale n’est pas disponible dans ce navigateur.

Loupe à concepts

Choisissez un terme technique de cette vue pour lire sa définition générale, un exemple pédagogique et son usage dans l’article.

Aucun terme de notre glossaire n’a été trouvé dans cette vue. Le glossaire ne couvre pas encore tous les termes.

DeepSeek est toujours décrit comme un petit laboratoire chinois, et le contraste reste saisissant : pas de budget à l’échelle d’OpenAI, une équipe des dizaines de fois plus petite, un accès limité aux derniers accélérateurs Nvidia et aucun campus de données tentaculaire. Pourtant, DeepSeek V4.1 Flash, présenté le 10 septembre 2026 comme le plus petit membre d’une nouvelle famille d’architectures, est présenté comme un prétendant de classe frontière. Il ne faut pas lire le .1 comme un correctif : son architecture de mélange d’experts de 552 milliards de paramètres est plus de 2,5 fois plus grande que le modèle qu’elle remplace et plus grande que les systèmes V3 et R1 qui ont d’abord fait connaître DeepSeek. Ce qui est inhabituel, c’est que cette échelle n’a pas gonflé la facture de service. Des poids ouverts sous licence MIT, des chemins d’exécution pour vLLM et SGLang, et un rapport technique sur Hugging Face sont arrivés en même temps que la sortie, si bien que l’affirmation ne se limite pas à une démo fermée.

Pour rendre l’affirmation d’efficacité lisible, la vidéo présente l’inférence en deux phases. Pendant la phase de lecture, l’invite et les documents joints sont découpés en jetons qui traversent les couches ; chaque couche émet deux ensembles de nombres par jeton, les clés et les valeurs, conservés dans un cache KV. Pendant la phase d’écriture, le modèle produit sa réponse jeton par jeton, en consultant ce cache pour choisir le jeton suivant le plus probable sans recalculer tout l’historique. L’analogie est nette : un étudiant qui suit des semaines de cours et prend des notes ne rejoue pas les cours pour répondre à une question ; il consulte ses notes. Le cache est ce cahier, et sa taille détermine si le travail semble léger ou pénible.

Pour une invite courte, le cahier reste mince et tient confortablement dans la mémoire à large bande passante, la surface rapide juste à côté du GPU. Les charges de travail d’agents brisent ce calme : les longues exécutions autonomes, les gros paquets de documents et le contexte à l’échelle d’une base de code gonflent le cache jusqu’à ce que le bureau déborde. La mémoire à large bande passante est rapide, mais petite et chère ; quand elle se remplit, le trop-plein se déverse sur les SSD hors GPU. Il y a plus d’espace là-bas, mais l’aller-retour est long. Chercher une note dans un classeur au bout du couloir prend bien plus de temps qu’un coup d’œil sur le bureau. Chaque prédiction du jeton suivant attend alors que les données traversent la carte mère, entrent dans la mémoire à large bande passante puis dans le processeur, laissant le calcul inactif. La vidéo nomme clairement les deux douleurs : l’une est l’étalement du calcul, l’autre la perte de vitesse due au déplacement d’une pile de notes sans cesse croissante.

Dans un transformeur standard, chaque couche écrit ses propres notes et le volume total du cache augmente avec le nombre de couches à mesure que les jetons avancent, s’ajoutent et bouclent. DeepSeek V4.1 Flash coupe à travers ce schéma. Sa colonne vertébrale de 40 couches est divisée en un encodeur causal de 20 couches et un décodeur de 20 couches, une disposition inspirée de YOCO qui ressemble plus à une refonte du modèle de base qu’à un réglage incrémental. L’encodeur assume la charge de lecture tandis que le décodeur s’efface largement du calcul de son propre cache global. L’étiquette .1 est donc plus administrative que technique ; la structure sous-jacente se comporte comme une nouvelle famille.

Les mécanismes sont simples à énoncer et délicats à équilibrer. Pendant la phase de lecture, la moitié décodeur reste largement inactive tandis que l’encodeur fait la lecture lourde et construit le cache KV global. Quand l’écriture commence, le décodeur ne relit pas tout ; il emprunte le cache global terminé, dérivé de l’état caché final de l’encodeur via des projections par couche. À première vue, la moitié du cerveau saute la lecture, ce qui suggère un risque de compréhension, et la vidéo est explicite sur ce compromis. L’équilibre d’ingénierie consiste à ne pas perdre le sens tout en sautant du travail. Le décodeur n’est pas aveugle ; il construit toujours son propre contexte local, la fenêtre étroite autour de la phrase en cours d’écriture, en utilisant l’attention à fenêtre glissante.

Séparer contexte global et contexte local : la fenêtre et l’analogie de l’exécutif

Le contexte global est l’ensemble complet donné au modèle, l’invite entière plus chaque document joint, un peu comme les notes de semaines de cours. Le contexte local est la tranche étroite pertinente pour le mot suivant, le libellé immédiat sous la plume. Le décodeur saute le recalcul de la pile globale et applique à la place une attention à fenêtre glissante qui ne s’attache qu’aux jetons les plus récents. La vidéo traduit cela en image organisationnelle : des analystes juniors lisent des milliers de pages, font les calculs et produisent un résumé exécutif dense ; les cadres supérieurs ne relisent pas les milliers de pages et s’appuient sur ce résumé pour s’orienter, puis mettent des lunettes de lecture pour examiner le libellé exact de la page devant eux avant de signer. Cette division permet à près de la moitié du modèle de contourner la création massive du cache global, réduisant presque de moitié le calcul nécessaire à la lecture. Le gonflement de la mémoire, lui, demeure ; la couche d’optimisation suivante s’y attaque directement.

Les chiffres les plus frappants se trouvent dans la section mémoire. Le KV global par jeton passe d’environ 390 000 octets dans DeepSeek V1 à 890 octets dans V4.1 Flash, soit une réduction d’environ 437 fois. La génération Flash précédente se situait autour de 3 500 octets, donc la nouvelle version est encore près de quatre fois plus légère. Le mécanisme derrière cela est l’attention sparse compressée 2, ou CSA2. Dans une pile conventionnelle, chaque couche écrit ses propres notes à partir de zéro ; CSA2 introduit un partage extrême avec trois modes assignés statiquement. Une couche Full crée son KV principal et un indexeur et sélectionne de nouveaux indices Top-512. Une couche Reindex réutilise le KV principal et les clés de l’indexeur de la dernière couche Full, mais les réévalue avec sa propre requête pour produire une nouvelle vue d’indexation. Une couche Reuse réutilise à la fois le KV principal et les derniers indices et ne crée presque rien de nouveau. Imaginez un même cahier exploré à travers trois tables des matières différentes : l’une chronologique, l’une thématique, l’une organisée autour des sauts technologiques. Les notes restent les mêmes tandis que les chemins de navigation se multiplient, et le stockage total s’effondre parce que de nombreuses couches évitent complètement de créer de nouvelles notes.

Le partage ne suffit pas ; un indexeur sparse hiérarchique resserre l’espace de recherche. La première couche du décodeur agit comme un gardien : elle scanne tout le cache global et assemble un pool de candidats d’environ 16 000 positions sur un million de jetons, organisé en 2 048 blocs de 8. Les couches suivantes n’ont pas le droit de chercher en dehors de ce pool. Cela semble risqué, comme si rétrécir l’ouverture pouvait créer des lacunes ou des hallucinations, et la vidéo soulève directement cette inquiétude. La réponse est que l’entraînement est ajusté pour que le pool de candidats soit assemblé avec une grande précision et que les couches suivantes remarquent à peine le reste manquant. Concrètement, 18 couches d’encodeur CSA2 fonctionnent en trois groupes de six avec un taux de compression de 2 selon un motif 1-Full plus 5-Reuse, tandis que 20 couches de décodeur fonctionnent en cinq groupes de quatre avec la première en Full plus 3-Reuse et les autres en Reindex plus 3-Reuse. Chaque couche conserve toujours sa propre requête principale et son KV à fenêtre glissante, mais la charge globale est partagée, et la facture le reflète avec environ un quart de la mémoire à large bande passante et un huitième du SSD.

Une autre décision contre-intuitive est la suppression de la mémoire à court terme. L’attention à fenêtre glissante crée une mémoire hyper-locale qui, dans les conversations à plusieurs tours, est mise en cache sur SSD tour après tour et obstrue le stockage. La réponse de DeepSeek, appelée SWA Bounded Replay, consiste à supprimer entièrement cette mémoire locale à la fin d’un tour et, si nécessaire, à ne recalculer que les 128 derniers jetons à partir de zéro sur place. Cela semble gaspilleur après un argumentaire d’une vidéo entière pour économiser le calcul, et la narration assume cette tension. Le compromis se résout par les mathématiques de latence. Persister la mémoire à court terme signifie pousser des octets du GPU à travers la carte mère vers un SSD puis les rapatrier plus tard, un long mouvement physique répété de nombreuses fois. Recalculer 128 jetons sur un GPU moderne est une rafale arithmétique à l’échelle de la microseconde qui ne coûte presque rien en temps ni en énergie. Réécrire les notes les plus récentes s’avère plus rapide que de les faire aller et venir dans le couloir, et libère au passage une part non négligeable de stockage.

Pièces complémentaires : MHC, Engram et DS-Spark

Trois pièces complémentaires complètent la colonne vertébrale. La première est MHC en une seule passe, qui réduit le trafic mémoire du GPU en alignant les opérations successives pour qu’elles s’exécutent ensemble plutôt que l’une après l’autre. Dans les travaux à contexte long, le modèle fait circuler des valeurs intermédiaires vers la mémoire et retour des milliards de fois ; chaque aller-retour est minuscule, mais multiplié, il devient le goulot d’étranglement, et la fusion des étapes réduit ce trafic. Une autre est Engram, un module mémoire séparé de 168 milliards de paramètres qui vit dans la RAM serveur moins chère plutôt que dans la mémoire GPU coûteuse et contient des faits statiques comme les dates, les capitales et d’autres connaissances fixes. L’analogie de l’avocat dans la vidéo aide : l’avocat senior se concentre sur la stratégie pendant qu’un assistant va chercher les citations précises à la demande, gardant l’esprit coûteux libre pour le raisonnement. La troisième est DS-Spark, déjà décrit dans une autre explication, qui permet au modèle d’émettre plusieurs mots à la fois au lieu d’un par un. Ensemble, ils maintiennent la mémoire rapide concentrée sur le raisonnement actif plutôt que sur le transport d’intermédiaires ou la mémorisation de trivia.

Quand les pièces se combinent, la courbe de coût s’aplatit d’une manière qui semble enfreindre les règles. La vidéo pointe la figure 2, où le calcul sur l’axe vertical est tracé en fonction de la taille de la fenêtre de contexte sur l’axe horizontal. Faire passer la fenêtre de 4 000 jetons standard à 1 million de jetons, soit environ 700 000 mots ou une base de code de taille moyenne, laisse la courbe de décodage de V4.1 Flash presque horizontale. Un document d’une page et un lot de mille pages coûtent une quantité d’énergie par mot similaire au moment de la génération, défiant l’attente habituelle selon laquelle un contexte plus grand implique un calcul proportionnellement plus grand. Les générations précédentes montent ; celle-ci reste stable. Pour une équipe qui se dit privée de calcul, le message est clair : optimiser le logiciel pour que le matériel n’ait pas à travailler aussi dur.

La performance n’est pas qu’une histoire d’efficacité. Sur DeepSWE v1.1, le modèle obtient 74,2, essentiellement à égalité ou légèrement devant GPT6 Astra à 74. Sur CyberGym pour la sécurité, il affiche 88,1 contre 84,5 pour le meilleur concurrent fermé, et sur AutomationBench 54,8 contre 50,3. Terminal-Bench 3.0 est le contrepoint à 30,0 contre 43,3, où Claude Opus 5 mène, un rappel clair que les tâches les plus difficiles centrées sur le terminal favorisent encore les géants. LiveBench le classe comme le meilleur modèle ouvert, et l’indice de Val pour les tâches de travail du savoir le place également premier. Une arène de design tierce citée dans la couverture de soutien a atteint 98 % de la moyenne d’Astra tout en réduisant le coût par tâche de 1,61 $ à 0,023 $, soit environ 1,4 % du prix, et en divisant le temps de 11,1 à 5,3 minutes. La vitesse de sortie via l’API dépasse 200 jetons par seconde, environ quatre fois GPT6 dans la comparaison montrée, et le temps jusqu’au premier jeton est parmi les plus bas rapportés. Le rapport technique est honnête : un écart subsiste sur les tâches d’agent les plus difficiles orientées science qui exigent une connaissance experte du domaine.

Dans l’ensemble, V4.1 Flash est moins une percée unique qu’un ensemble de choix alignés : attention à fenêtre glissante pour un focus local serré, cerveau divisé qui réduit presque de moitié le calcul de préremplissage, CSA2 avec Full, Reindex et Reuse plus un pool de candidats hiérarchique qui comprime le cache KV de deux ordres de grandeur par rapport à la génération précédente, replay borné qui supprime et recalcule 128 jetons au lieu de faire circuler la mémoire locale dans le stockage, chemin MHC fusionné qui réduit le trafic, magasin Engram qui déplace les faits statiques vers une RAM bon marché, et DS-Spark pour l’émission multi-mots. Le résultat est un MoE multimodal d’un million de jetons, entraîné sur 45 000 milliards de jetons, prenant en charge jusqu’à 384 000 jetons de sortie, offrant des niveaux de raisonnement low, high et max, et demandant environ un quart de la mémoire à large bande passante et un huitième du SSD de son prédécesseur. Publié sous le nom deepseek-flash, avec les anciens noms retirés et des poids ouverts pour téléchargement local, cela signale une intention : ce Frankenstein d’efficacité est fait pour être testé sur de vraies bases de code d’agents, pas admiré comme un graphique de laboratoire.

Visualization: nodesdaily AI

Moments clés

  1. Ouverture — un objectif de frontière sous contraintes
  2. Cache KV : l’image du bureau et du classeur
  3. Cerveau divisé : moitiés encodeur et décodeur
  4. Partage CSA2 : trois modes et tables d’index
  5. Gardien et pool de candidats : de 1M à 16K
  6. Replay borné SWA : recalculer 128 jetons
  7. MHC, Engram, DS-Spark et la courbe plate
  8. Scores, vitesse et coût : conclusion avec des poids ouverts

Commentaire de l’IA

"« Ce qui m’a le plus frappé, c’est le refus de courir après le matériel et le choix de resserrer plutôt le logiciel ; réduire les notes d’environ 390 000 octets à 890 octets évoque un système de classement plus intelligent plutôt qu’un campus plus grand, et le publier avec des poids ouverts rend l’affirmation vérifiable. »"

Évaluation de l’IA

Prenons d’abord le contre-argument le plus solide et le tableau devient plus prudent : la compression et le partage centrés sur le logiciel sont frappants sur les factures mémoire et la latence, mais la profondeur du raisonnement et les connaissances de domaine rares ne s’améliorent pas automatiquement au même rythme que l’efficacité. La vidéo le concède elle-même : sur les tâches d’agent les plus difficiles orientées science, les plus grands modèles fermés restent en tête. Si la lecture ne s’appuie que sur les bancs de codage et d’automatisation, extrapoler une parité frontière généralisée exagère les preuves. Les avantages de coût dépendent aussi d’un instantané de prix dans une seule arène de design ; changez le type de tâche, le nombre de répétitions ou la tarification du fournisseur, et un chiffre phare comme 1,4 % peut bouger.

Les limites méthodologiques méritent une mention. La courbe aplatie décrit le coût moyen de décodage par mot, pas le coût total du travail ; le coût total augmente toujours avec un contexte plus grand, juste plus lentement. Les taux de compression KV arrivent avec la quantification FP4 et un entraînement sensible à la quantification, qui préservent le gain quantitatif mais exigent des vérifications supplémentaires sur la stabilité numérique dans les longues chaînes. Réduire un champ d’un million de jetons à un pool de candidats de 16 384 entrées rend la précision dépendante de la construction du pool ; des contextes hors distribution pourraient dégrader le taux de succès du pool et laisser aux couches suivantes aucune chance de récupérer. Le replay borné est extrêmement bon marché pour une fenêtre de 128 jetons, mais un état où l’historique conversationnel est activement supprimé soulève des questions sur les longues chaînes de référence dans les agents de production et nécessite des tests au niveau produit.

La provenance et la vérifiabilité comptent aussi. Le récit s’appuie sur le rapport technique de DeepSeek et l’interprétation d’une seule vidéo, donc des exécutions indépendantes peuvent montrer des variations, surtout sur la vitesse, le temps jusqu’au premier jeton et le coût détaillé. Les chiffres clés se reproduisent bien d’une source à l’autre : 552B au total avec 8B de préremplissage et 16B de décodage actifs, contexte de 1M, KV global de 890 octets, environ un quart de la mémoire à large bande passante et un huitième du SSD par rapport à la génération précédente apparaissent dans la note officielle et dans les résumés de Meta AI Labs et The Decoder. Néanmoins, « égaler la frontière » dépend du banc d’essai ; être fort sur DeepSWE et CyberGym et en retard sur Terminal-Bench relève plus d’un tableau de bord équilibré que d’un rang unique. Le contrôle le plus robuste est de relancer les mêmes invites localement via vLLM ou SGLang sur votre propre charge de travail.

La conclusion pratique varie selon l’équipe. Pour les équipes d’agents qui vivent dans des contextes longs, de grandes bases de code et l’utilisation d’outils multi-tours, V4.1 Flash est un choix par défaut convaincant ; les économies de mémoire et de coût se traduisent directement en budget d’itération et les poids ouverts permettent des essais locaux. Pour les produits où le temps jusqu’au premier jeton est critique, les 200 jetons par seconde annoncés et la faible latence initiale sont significatifs. Là où le travail penche vers le calcul scientifique de niche, la vérification formelle ou les longues séquences terminales du genre Terminal-Bench, les plus grands modèles fermés devraient rester la référence. Pour les projets intermédiaires, la voie la plus saine est d’exécuter les niveaux de raisonnement low, high et max côte à côte sur les mêmes tâches et de tracer votre propre courbe coût-qualité ; l’efficacité ne se cumule que lorsqu’elle est mesurée par rapport à la précision dans votre domaine.

Sources

7 liens ; 3 d’entre eux sont aussi cités par 4 autres articles. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

intelligence artificielle · deepseek · v4.1 · flash · scission · cerveau · nodesdaily

Suivre le sujet

Avant cet article

Un court ordre de lecture des articles antérieurs reliés à cet événement par un éditeur.

Preuves et sources

Consultez les passages autorisés, leurs versions et leur origine.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…