DeepSeek V4.1 Flash, Two Minute Papers'ın 'İnanılmaz Yeni Mimari' diye açtığı videonun merkezinde duruyor. Sunucu, modelin hızıyla başlıyor ve iki iddiayı yan yana koyuyor: Flash, bazı testlerde Claude Opus sınıfını ve hatta Kimi K3'ü geride bırakabiliyor, üstelik DeepSeek V4'ü de istikrarlı biçimde geçiyor. Yerelde V4 Pro'yu koşturmanın kabaca 300 bin dolarlık bir donanım istediği anlatılırken, Flash'ın aynı işi yaklaşık dörtte bir maliyetle yapması, eğrinin nereye gittiğini gösteriyor. Cebimize sığan bir ajana bir yıl uzaktayız vurgusu, bu yüzden temkinli bir iyimserlikle veriliyor.
Ne hızlandı, ne küçüldü: 437 katın anatomisi
İşin en çarpıcı kısmı, modelin aynı anda hem 'huge' hem 'small' olması. Huge, çünkü omurga 552 milyar parametre ve 1 milyon tokene kadar bağlam taşıyor; video '500 milyardan fazla' diyerek ölçeği işaret ediyor. Small ise, bağlamı tutan KV önbelleğinin küçülmesi. Paper'ın özeti net: V1'e göre 437 kat, sadece birkaç ay önceki V4 Flash'a göre ise 4 kat daha küçük bir global KV. ArXiv 2609.19969'a göre global ayak izi token başına 890 bayta iniyor — HBM'de sürekli duran kısım V4 Flash'ın dörtte biri. Kalıcı kısım için SWA Bounded Replay ile SSD/host bellekte tutulan iz, V4 Flash'ın sekizde birine düşüyor. Yani uzun ajan görevlerinde en pahalı kalem olan bellek ve bant genişliği doğrudan kırpılıyor.
Bu küçülme nasıl mümkün? Videodaki açıklama, tekniğin adını veriyor: Compressed Sparse Attention 2, kısaca CSA2. Geleneksel Transformer'da her katman kendi KV hafızasını ayrı tutarken, DeepSeek V4.1 Flash bu hafızayı katmanlar arasında paylaştırıyor. Herkesin her şeyi hatırlaması yerine, tek bir ortak hafıza var. Bunu kotarmanın zorluğu, farklı katmanların aynı geçmişe farklı bakış açısıyla ihtiyaç duyması. Çözüm, 40 katmanlı Causal Encoder-Decoder, yani CED mimarisi: 20 katmanlı nedensel kodlayıcı, nihai gizli durumlardan global bir bellek üretiyor; 20 katmanlı kod çözücü ise kendi katman durumlarından değil, bu global bellekten okuyor. Üstüne FP4 KV önbellekleme eklenince, hem HBM hem de SSD tarafındaki ayak izi dramatik biçimde düşüyor.
Mimarinin sayıları: 8B prefill, 16B decode, 45 trilyon token
CED'in getirdiği asimetri, ajan iş yükleri için kritik. Model, kod çözme sırasında token başına 16 milyar parametreyi aktive ederken, ön doldurmada yalnızca 8 milyar parametre ile ilerliyor. Girdi-ağır ajan senaryolarında prefill maliyetini yarıya çekmek, faturayı doğrudan düşürüyor. DeepSeek ekibi mimariyi sadeleştirmenin yanında birkaç verimli eklenti de eklemiş ve modeli 45 trilyon tokenlik çok modlu bir korpus üzerinde ön eğitmiş; ardından metin ve çok modlu ajan senaryolarında kapsamlı post-training yapmış. Hugging Face'te açık kontrol noktaları ve DeepSeek sitesindeki tanıtım, 'en küçük yeni aile üyesi ama görsel anlama yerleşik' diye konumlanıyor — 10 Eylül 2026 tarihli duyuru, daha yüksek üretim hızı ve iş hacmi vaadini öne çıkarıyor.
Video sadece mimari anlatmıyor, iki somut yetenek demosu da veriyor. İlki, yerleşik görsel anlama: ikonik bir oyun menüsünün görselini verip, onu birebir yineleyen bir oyunu yazdırması. İkincisi, fizik simülasyonu: 'bal sarmalanması' makalesini yeniden üretme denemesinde GPT-6 Astra'nın sonucu 'nefes kesici' bulunurken, Opus 5.1'in fiziği güçlü ama render tarafı bir adım geride kalıyor. DeepSeek V4.1 Flash için sunucu, 'birkaç makale daha sonra bu seviyeye de gelir, eminim' diyor ve başlıklara körü körüne inanmak yerine hakikati gösterme iddiasını vurguluyor. YouTube'un fizik videolarını daha az önermesinden duyduğu burukluğu da esprili bir şekilde ekliyor.
Püf noktası ve maliyet: çok düşünen, çok token yakan model
Videonun sonundaki 'catch' bölümü, hikâyeyi dengeye getiriyor. V4.1 Flash, düşünmeyi seviyor ve çok token yakıyor. Fiyat ucuz kalmış olsa da, toplam token hacmi yüksek. Donanımı olan için API'siz, ücretsiz koşturma mümkün; olmayan için Lambda gibi GPU bulutları pratik köprü oluyor. Sunucu, her yeni DeepSeek makalesiyle birlikte tüm ekosistem için çıkarım maliyetinin düştüğünü ve bunun doktorlar, bilim insanları gibi yüksek etkili kullanıcılar için doğrudan fayda ürettiğini söylüyor. Açık model ve açık makale kombinasyonu, 'open science for the win' hissini güçlendiriyor.
Toparlarsak, DeepSeek V4.1 Flash'in çılgınlığı kas gücünde değil, hafıza ekonomisinde. Katmanlar arası paylaşım, kodlayıcıdan kod çözücüye projeksiyon ve FP4 sıkıştırma üçlüsü, 1 milyon tokenlik bağlamı 890 baytlık bir token izine indirgerken performansı da taban çizgisinin üzerine taşıyor. Yerelde 300 bin dolarlık bariyerin dörtte birine çekilmesi, modelin bir yıl içinde cebe inebileceği beklentisini spekülasyondan çıkarıp mühendislik yol haritasına dönüştürüyor. Video, bu dönüşümü 437 kat ve 4 kat gibi iki ölçekte aynı anda anlatmayı başardığı için, mimariyi merak eden herkes için iyi bir başlangıç çerçevesi sunuyor.
| Model | Global KV / token | Kalıcı KV | Mimari |
|---|---|---|---|
| V4.1-Flash | 890 bayt | V4-Flash'in 1/8'i | CED 20+20, CSA2+FP4 |
| V4-Flash | 4x daha büyük | 1x (referans) | Standart MoE |
| V1 (3 yıl önce) | 437x daha büyük | — | İlk nesil |
Videodaki anahtar anlar
AI yorumu
"Bu videoyu izlerken beni en çok çarpan şey, 'daha büyük model' ezberinin tersine dönmesi oldu. DeepSeek, modeli büyütürken hafızayı küçültmeyi başarmış — bence bu, ajanların cebimize girmesi için gerçek eşik."
AI değerlendirmesi
En güçlü haliyle bakınca, DeepSeek'in hamlesi ajan ekonomisini doğru yerden vuruyor. Uzun bağlamın maliyeti uzun süredir 'prefill pahalı, KV şişkin, HBM/SSD darboğazı' üçlüsünde düğümleniyordu; CED + CSA2 + FP4 bu düğümü aynı anda gevşetiyor ve bunu teoride değil, 890 bayt/token gibi ölçülebilir bir izle yapıyor. Token başına 8B prefill ile 16B decode ayrımı da, girdi-ağır gerçek dünya ajanlarında faturayı doğrudan düşüren nadir mimari kazançlardan biri.
Sınırlar tarafında, video kısa ve tek kaynaklı; performans cümleleri 'bazı testlerde' diye ihtiyatlı kuruluyor ama hangi kıyasın hangi veri kümesinde, hangi toleransta geçtiği ekranda yok. 300 bin dolar ve çeyreği gibi maliyetler, donanım konfigürasyonu ve bellek tipine göre hızla değişir; izleyici kendi yığını için doğrulamadan bütçe çıkarmamalı. Honey-coiling gibi görsel fizik demoları etkileyici olsa da, tek bir makalenin yeniden üretimi genellenebilirlik kanıtı değil — farklı fizik, farklı domainlerde aynı isabet beklenmemeli.
Çıkar ve doğrulama açısından, arXiv 2609.19969 ve Hugging Face kontrol noktaları dayanağı güçlendiriyor; 10 Eylül 2026 DeepSeek duyurusu da mimariyi ve 45T token ön eğitimi teyit ediyor. Yine de SWA Bounded Replay'in gerçek dağıtımda ne kadar sorunsuz çalıştığı, FP4 KV'nin uzun bağlamda kaliteyi hangi eşikte etkilediği ve 1M token bağlamın hangi iş yüklerinde gerçekten tutulduğu, bağımsız tekrar üretimi bekleyen başlıklar. Token yakma tarafı da şeffaflık istiyor: düşünme izleri uzadıkça toplam maliyet düşse bile kullanım dalgalanıyor.
Pratik çıkarım net: uzun bağlamlı ajan, RAG ve çok modlu asistan koşturan ekipler için V4.1 Flash, bellek ve prefill bütçesini ciddiye alan bir deneme adayı; donanımı olan için yerelde, olmayan için Lambda benzeri kiralık GPU'da test edilebilir. Kısa bağlamlı, düşük gecikmeli sohbet için kazanç daha sınırlı olabilir ve 'çok düşünen' yapısı gereği yanıt başına token hesabı yapılmalı. Açık ağırlık + açık makale, denemeyi düşük sürtünmeli kılıyor — karar öncesi kendi veri kümenizde ölçün, sonra ölçekleyin.
Kaynaklar
6 bağlantı; 2 tanesi 4 başka haberde de kullanılıyor. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.
- @youtube.com YouTube — DeepSeek V4.1 Flash'in Çılgın Mimarisi: Paylaşımlı Hafızayla 437 Kat K
- @arxiv.org https://arxiv.org/abs/2609.19969
- @huggingface.co https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
Aynı kaynağı kullanan: DeepSeek V4.1 Flash Pro Tarafının Yerine Geçiyor: Asimetrik Tasarım Cephe Ajan Yarışına Giriyor
- @deepseek.com https://www.deepseek.com/en/news/deepseek-v4-1-flash/
Aynı kaynağı kullanan: DeepSeek V4.1 Flash’ta Ayrılan Beyin: 890 Baytlık Notlarla Sınır Modellerine Meydan · DeepSeek V4.1 Flash Pro Tarafının Yerine Geçiyor: Asimetrik Tasarım Cephe Ajan Yarışına Giriyor · Yapay Zeka Tier Listesi Sıfırlandı: GPT-6 Astra Zirvede, Abonelik Matematiği Dengeleri Değiştirdi · DeepSeek V4.1 Flash: Ucuz, Hızlı, Açık — Ama Test Masasında Pürüzlü
- @lambda.ai https://lambda.ai/papers
- @arxiv.org https://arxiv.org/abs/2505.03648
deepseek · yapay zeka · kv cache · csa2 · moe · nodesdaily