DeepSeek V4.1 Flash est au cœur de l'épisode « Insane New Architecture » de Two Minute Papers, qui s'ouvre sur une vitesse fulgurante et deux affirmations audacieuses : sur certains benchmarks, Flash peut dépasser les modèles de classe Claude Opus et Kimi K3, et il bat de manière fiable DeepSeek V4 lui-même. L'hôte chiffre le coût pour rendre le propos tangible — faire tourner V4 Pro en local demande environ 300 000 $ de matériel, tandis que Flash fait le même travail pour environ un quart de ce prix. La courbe pointe vers un agent de poche d'ici un an, présenté comme un optimisme prudent plutôt que du hype.
Ce qui est devenu plus rapide, ce qui est devenu plus petit : l'anatomie du 437x
L'idée la plus frappante est que le modèle est à la fois énorme et minuscule. Énorme parce que l'ossature compte 552 milliards de paramètres avec jusqu'à un million de tokens de contexte — la vidéo mentionne « plus de 500 milliards ». Minuscule parce que le cache KV qui stocke le contexte s'effondre : 437x plus petit que V1 d'il y a trois ans et 4x plus petit que V4 Flash d'il y a quelques mois à peine. L'abstract de l'article arXiv 2609.19969 fixe le chiffre : empreinte globale ramenée à 890 octets par token, soit environ un quart de DeepSeek-V4-Flash en HBM. Avec SWA Bounded Replay, l'empreinte persistante sur SSD ou mémoire hôte tombe à environ un huitième de V4-Flash. Pour les charges de travail d'agents à long horizon et gourmandes en entrées, cela attaque directement le goulot d'étranglement du calcul, du stockage et de la bande passante.
Comment cette réduction est-elle obtenue ? La vidéo le nomme : Compressed Sparse Attention 2, CSA2. Dans un Transformer classique, chaque couche conserve sa propre mémoire KV ; DeepSeek V4.1 Flash la partage entre les couches. Tout le monde n'a pas besoin de tout retenir — il existe une mémoire partagée. La difficulté, c'est que différentes couches ont besoin de vues différentes d'une même histoire. La solution est un Causal Encoder-Decoder à 40 couches, CED : un encodeur causal de 20 couches projette une mémoire globale à partir de ses derniers états cachés, et un décodeur de 20 couches lit cette mémoire globale au lieu de dériver le KV de ses propres états. Ajoutez le cache KV en FP4, et le cache global résident en HBM comme le cache persistant résident sur SSD chutent fortement.
Les chiffres de l'architecture : 8B en préfill, 16B en décode, 45T de tokens
L'asymétrie compte pour l'économie des agents. Le modèle active 16B de paramètres par token pendant le décode mais seulement 8B pendant le préfill, ce qui divise par deux le coût du préfill pour les tâches gourmandes en entrées. DeepSeek rapporte avoir rationalisé l'architecture V4, ajouté des extensions efficaces, et pré-entraîné sur un corpus multimodal de 45T de tokens suivi d'un post-entraînement étendu pour les scénarios d'agents textuels et multimodaux. L'annonce du 10 septembre 2026 sur deepseek.com le positionne comme le plus petit membre de la nouvelle famille avec une compréhension visuelle native, promettant une inférence plus rapide et un débit supérieur. Les checkpoints sont ouverts sur Hugging Face.
La vidéo ne s'arrête pas à l'architecture ; elle montre deux sondes de capacités concrètes. D'abord, la compréhension visuelle native — on fournit au modèle l'image d'un menu de jeu emblématique et on lui fait écrire un jeu qui la reproduit. Ensuite, la reproduction physique — sur l'article du honey-coiling, GPT-6 Astra réussit le résultat de façon « absolument stupéfiante », Opus 5.1 obtient la bonne physique avec un rendu légèrement plus faible, et Flash est présenté à quelques articles de ce niveau. L'hôte insiste sur la nécessité de montrer la vérité au-delà des titres et note, avec une pique ironique, que YouTube a cessé de recommander ses articles sur les simulations physiques.
Le hic et la facture : un modèle qui réfléchit beaucoup et brûle des tokens
Le hic à la fin rééquilibre le récit. V4.1 Flash aime réfléchir et brûle beaucoup de tokens. Il n'est pas cher par token, mais le volume total est élevé. Avec du matériel, vous pouvez le faire tourner gratuitement ; sans, le cloud GPU de Lambda est présenté comme le pont pratique — l'hôte précise qu'il utilise Lambda pour reproduire des articles en quelques minutes et tester des idées rapidement. Chaque nouvel article de DeepSeek, dit l'argument, abaisse le coût d'inférence pour tous, ce qui aide directement les médecins et les scientifiques. Des poids ouverts plus un article ouvert maintiennent intact le fil conducteur « la science ouverte gagne ».
En prenant du recul, la folie de V4.1 Flash n'est pas la force brute mais l'économie de la mémoire. Le partage inter-couches, la projection encodeur-vers-décodeur et la compression FP4 réduisent ensemble un contexte d'un million de tokens à une trace de 890 octets par token tout en poussant les performances au-dessus de la référence. Réduire une barrière locale de 300 000 $ à un quart et diviser par deux l'activation du préfill transforme la phrase « dans votre poche d'ici un an » de spéculation en feuille de route d'ingénierie. En racontant la réduction à deux échelles à la fois — 437x vs V1 et 4x vs V4 Flash — la vidéo offre un cadre compact pour quiconque suit les architectures.
Moments clés
- Intro — pourquoi V4.1 Flash enthousiasme
- Surprise de performance — battre V4 et la classe Opus
- Compréhension visuelle — de l'image de menu au jeu
- Le secret de la réduction — CSA2 et mémoire partagée
- Dans l'architecture — CED 20+20 et FP4
- Démo physique — honey coiling, Astra vs Opus
- Le hic — réfléchir fort, brûler des tokens
Commentaire de l’IA
"« Ce qui m'a le plus frappé ici, c'est l'inversion de l'orthodoxie du 'modèle plus grand'. DeepSeek a agrandi le modèle tout en réduisant la mémoire — pour moi, c'est le vrai seuil pour que les agents tiennent dans nos poches. »"
Évaluation de l’IA
À défendre au meilleur de sa forme, DeepSeek frappe l'économie des agents là où ça fait mal. Le coût du long contexte est depuis longtemps bloqué sur « le préfill est cher, le KV est gonflé, le HBM/SSD est le goulot » ; CED plus CSA2 plus FP4 desserrent ce nœud d'un coup, et le font avec un 890 octets par token mesurable, pas un slogan. La répartition 8B en préfill contre 16B en décode est l'une des rares victoires architecturales qui abaissent directement la facture pour des agents réels gourmands en entrées.
Les limites comptent. La vidéo est courte et à source unique ; les lignes de performance sont nuancées par « sur certains tests » sans jeu de données, tolérance ni dispersion statistique à l'écran. Les repères de coût comme 300 000 $ et un quart fluctuent vite selon le matériel et la configuration mémoire — les spectateurs ne devraient pas budgétiser sur la seule anecdote. La démo physique du honey-coiling est frappante, mais la reproduction d'un seul article n'est pas une preuve de généralité ; d'autres physiques et domaines pourraient ne pas se transférer avec la même fidélité.
Sur les enjeux et la vérifiabilité, arXiv 2609.19969 et les checkpoints Hugging Face renforcent la base, et l'annonce DeepSeek du 10 septembre 2026 confirme l'architecture et le pré-entraînement de 45T de tokens. Restent à reproduire indépendamment : le comportement fluide de SWA Bounded Replay en production, le point où le KV FP4 commence à mordre sur la qualité à très long contexte, et les charges qui soutiennent réellement 1M de tokens. Le côté brûlage de tokens exige aussi de la transparence : même si le coût unitaire est bas, le coût total fluctue à mesure que les traces de réflexion s'allongent.
En pratique, les équipes qui font tourner des agents à long contexte, du RAG ou des assistants multimodaux devraient traiter V4.1 Flash comme un essai sérieux pour les budgets mémoire et préfill — en local si vous avez le matériel, sur du GPU loué comme Lambda sinon. Pour le chat à court contexte et sensible à la latence, le gain est plus étroit, et le caractère « aime réfléchir » impose de compter les tokens par réponse. Des poids ouverts plus un article ouvert rendent l'essai à faible friction — mesurez sur vos propres données avant de passer à l'échelle.
Sources
6 liens ; 2 d’entre eux sont aussi cités par 4 autres articles. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
- @youtube https://www.youtube.com/watch?v=vIHw_2VjSUw
- @arxiv https://arxiv.org/abs/2609.19969
- @huggingface https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
Également cité par : DeepSeek V4.1 Flash Takes Over for Pro: Asymmetric Design Joins the Frontier-Agent Race
- @deepseek https://www.deepseek.com/en/news/deepseek-v4-1-flash/
Également cité par : DeepSeek V4.1 Flash and the Split Brain: Challenging Frontier Models with 890-Byte Notes · DeepSeek V4.1 Flash Takes Over for Pro: Asymmetric Design Joins the Frontier-Agent Race · AI Tier List Reset: GPT-6 Astra Takes the Crown as Subscription Math Rewrites the Ranks · DeepSeek V4.1 Flash: Cheap, Fast and Open — yet Rough on the Test Bench
- @lambda https://lambda.ai/papers
- @arxiv https://arxiv.org/abs/2505.03648
deepseek · intelligence artificielle · cache kv · csa2 · moe · nodesdaily