Gündeme dön

DeepSeek V4.1 Flash'in Çılgın Mimarisi: Paylaşımlı Hafızayla 437 Kat Küçülen KV

Two Minute Papers'ın ele aldığı DeepSeek V4.1 Flash, 552 milyar parametreli bir MoE modelini 1 milyon token bağlama taşırken KV önbelleğini V1'e göre 437 kat, bir önceki Flash'a göre 4 kat küçültüyor. Sır, katmanlar arası paylaşılan hafıza ve CSA2 ile FP4 sıkıştırmada.

Nodesdaily’e aktarım: (UTC+03:00)
YouTube'da izle — vIHw_2VjSUw
Okuma seçenekleri

Bu tarayıcıda cihazdan sesli okuma kullanılamıyor.

Kavram merceği

Bu görünümde geçen teknik kavramlardan birini seç. Genel tanımı, öğretici örneği ve haberdeki kullanımını birlikte oku.

Bu görünümde sözlüğümüzdeki kavramlardan biri bulunmadı. Sözlük henüz tüm terimleri kapsamıyor.

DeepSeek V4.1 Flash, Two Minute Papers'ın 'İnanılmaz Yeni Mimari' diye açtığı videonun merkezinde duruyor. Sunucu, modelin hızıyla başlıyor ve iki iddiayı yan yana koyuyor: Flash, bazı testlerde Claude Opus sınıfını ve hatta Kimi K3'ü geride bırakabiliyor, üstelik DeepSeek V4'ü de istikrarlı biçimde geçiyor. Yerelde V4 Pro'yu koşturmanın kabaca 300 bin dolarlık bir donanım istediği anlatılırken, Flash'ın aynı işi yaklaşık dörtte bir maliyetle yapması, eğrinin nereye gittiğini gösteriyor. Cebimize sığan bir ajana bir yıl uzaktayız vurgusu, bu yüzden temkinli bir iyimserlikle veriliyor.

Ne hızlandı, ne küçüldü: 437 katın anatomisi

İşin en çarpıcı kısmı, modelin aynı anda hem 'huge' hem 'small' olması. Huge, çünkü omurga 552 milyar parametre ve 1 milyon tokene kadar bağlam taşıyor; video '500 milyardan fazla' diyerek ölçeği işaret ediyor. Small ise, bağlamı tutan KV önbelleğinin küçülmesi. Paper'ın özeti net: V1'e göre 437 kat, sadece birkaç ay önceki V4 Flash'a göre ise 4 kat daha küçük bir global KV. ArXiv 2609.19969'a göre global ayak izi token başına 890 bayta iniyor — HBM'de sürekli duran kısım V4 Flash'ın dörtte biri. Kalıcı kısım için SWA Bounded Replay ile SSD/host bellekte tutulan iz, V4 Flash'ın sekizde birine düşüyor. Yani uzun ajan görevlerinde en pahalı kalem olan bellek ve bant genişliği doğrudan kırpılıyor.

Bu küçülme nasıl mümkün? Videodaki açıklama, tekniğin adını veriyor: Compressed Sparse Attention 2, kısaca CSA2. Geleneksel Transformer'da her katman kendi KV hafızasını ayrı tutarken, DeepSeek V4.1 Flash bu hafızayı katmanlar arasında paylaştırıyor. Herkesin her şeyi hatırlaması yerine, tek bir ortak hafıza var. Bunu kotarmanın zorluğu, farklı katmanların aynı geçmişe farklı bakış açısıyla ihtiyaç duyması. Çözüm, 40 katmanlı Causal Encoder-Decoder, yani CED mimarisi: 20 katmanlı nedensel kodlayıcı, nihai gizli durumlardan global bir bellek üretiyor; 20 katmanlı kod çözücü ise kendi katman durumlarından değil, bu global bellekten okuyor. Üstüne FP4 KV önbellekleme eklenince, hem HBM hem de SSD tarafındaki ayak izi dramatik biçimde düşüyor.

Mimarinin sayıları: 8B prefill, 16B decode, 45 trilyon token

CED'in getirdiği asimetri, ajan iş yükleri için kritik. Model, kod çözme sırasında token başına 16 milyar parametreyi aktive ederken, ön doldurmada yalnızca 8 milyar parametre ile ilerliyor. Girdi-ağır ajan senaryolarında prefill maliyetini yarıya çekmek, faturayı doğrudan düşürüyor. DeepSeek ekibi mimariyi sadeleştirmenin yanında birkaç verimli eklenti de eklemiş ve modeli 45 trilyon tokenlik çok modlu bir korpus üzerinde ön eğitmiş; ardından metin ve çok modlu ajan senaryolarında kapsamlı post-training yapmış. Hugging Face'te açık kontrol noktaları ve DeepSeek sitesindeki tanıtım, 'en küçük yeni aile üyesi ama görsel anlama yerleşik' diye konumlanıyor — 10 Eylül 2026 tarihli duyuru, daha yüksek üretim hızı ve iş hacmi vaadini öne çıkarıyor.

Video sadece mimari anlatmıyor, iki somut yetenek demosu da veriyor. İlki, yerleşik görsel anlama: ikonik bir oyun menüsünün görselini verip, onu birebir yineleyen bir oyunu yazdırması. İkincisi, fizik simülasyonu: 'bal sarmalanması' makalesini yeniden üretme denemesinde GPT-6 Astra'nın sonucu 'nefes kesici' bulunurken, Opus 5.1'in fiziği güçlü ama render tarafı bir adım geride kalıyor. DeepSeek V4.1 Flash için sunucu, 'birkaç makale daha sonra bu seviyeye de gelir, eminim' diyor ve başlıklara körü körüne inanmak yerine hakikati gösterme iddiasını vurguluyor. YouTube'un fizik videolarını daha az önermesinden duyduğu burukluğu da esprili bir şekilde ekliyor.

Püf noktası ve maliyet: çok düşünen, çok token yakan model

Videonun sonundaki 'catch' bölümü, hikâyeyi dengeye getiriyor. V4.1 Flash, düşünmeyi seviyor ve çok token yakıyor. Fiyat ucuz kalmış olsa da, toplam token hacmi yüksek. Donanımı olan için API'siz, ücretsiz koşturma mümkün; olmayan için Lambda gibi GPU bulutları pratik köprü oluyor. Sunucu, her yeni DeepSeek makalesiyle birlikte tüm ekosistem için çıkarım maliyetinin düştüğünü ve bunun doktorlar, bilim insanları gibi yüksek etkili kullanıcılar için doğrudan fayda ürettiğini söylüyor. Açık model ve açık makale kombinasyonu, 'open science for the win' hissini güçlendiriyor.

Toparlarsak, DeepSeek V4.1 Flash'in çılgınlığı kas gücünde değil, hafıza ekonomisinde. Katmanlar arası paylaşım, kodlayıcıdan kod çözücüye projeksiyon ve FP4 sıkıştırma üçlüsü, 1 milyon tokenlik bağlamı 890 baytlık bir token izine indirgerken performansı da taban çizgisinin üzerine taşıyor. Yerelde 300 bin dolarlık bariyerin dörtte birine çekilmesi, modelin bir yıl içinde cebe inebileceği beklentisini spekülasyondan çıkarıp mühendislik yol haritasına dönüştürüyor. Video, bu dönüşümü 437 kat ve 4 kat gibi iki ölçekte aynı anda anlatmayı başardığı için, mimariyi merak eden herkes için iyi bir başlangıç çerçevesi sunuyor.

ModelGlobal KV / tokenKalıcı KVMimari
V4.1-Flash890 baytV4-Flash'in 1/8'iCED 20+20, CSA2+FP4
V4-Flash4x daha büyük1x (referans)Standart MoE
V1 (3 yıl önce)437x daha büyük—İlk nesil

Videodaki anahtar anlar

  1. Giriş — V4.1 Flash neden heyecanlandırıyor
  2. Performans sürprizi — V4 ve Opus sınıfı iddiası
  3. Görsel anlama — oyun menüsünden oyuna
  4. Küçülmenin sırrı — CSA2 ve paylaşımlı hafıza
  5. Mimarinin içi — CED 20+20 ve FP4
  6. Fizik demosu — bal sarmalanması ve Astra vs Opus
  7. Püf noktası — çok token yakan düşünme

AI yorumu

"Bu videoyu izlerken beni en çok çarpan şey, 'daha büyük model' ezberinin tersine dönmesi oldu. DeepSeek, modeli büyütürken hafızayı küçültmeyi başarmış — bence bu, ajanların cebimize girmesi için gerçek eşik."

AI değerlendirmesi

En güçlü haliyle bakınca, DeepSeek'in hamlesi ajan ekonomisini doğru yerden vuruyor. Uzun bağlamın maliyeti uzun süredir 'prefill pahalı, KV şişkin, HBM/SSD darboğazı' üçlüsünde düğümleniyordu; CED + CSA2 + FP4 bu düğümü aynı anda gevşetiyor ve bunu teoride değil, 890 bayt/token gibi ölçülebilir bir izle yapıyor. Token başına 8B prefill ile 16B decode ayrımı da, girdi-ağır gerçek dünya ajanlarında faturayı doğrudan düşüren nadir mimari kazançlardan biri.

Sınırlar tarafında, video kısa ve tek kaynaklı; performans cümleleri 'bazı testlerde' diye ihtiyatlı kuruluyor ama hangi kıyasın hangi veri kümesinde, hangi toleransta geçtiği ekranda yok. 300 bin dolar ve çeyreği gibi maliyetler, donanım konfigürasyonu ve bellek tipine göre hızla değişir; izleyici kendi yığını için doğrulamadan bütçe çıkarmamalı. Honey-coiling gibi görsel fizik demoları etkileyici olsa da, tek bir makalenin yeniden üretimi genellenebilirlik kanıtı değil — farklı fizik, farklı domainlerde aynı isabet beklenmemeli.

Çıkar ve doğrulama açısından, arXiv 2609.19969 ve Hugging Face kontrol noktaları dayanağı güçlendiriyor; 10 Eylül 2026 DeepSeek duyurusu da mimariyi ve 45T token ön eğitimi teyit ediyor. Yine de SWA Bounded Replay'in gerçek dağıtımda ne kadar sorunsuz çalıştığı, FP4 KV'nin uzun bağlamda kaliteyi hangi eşikte etkilediği ve 1M token bağlamın hangi iş yüklerinde gerçekten tutulduğu, bağımsız tekrar üretimi bekleyen başlıklar. Token yakma tarafı da şeffaflık istiyor: düşünme izleri uzadıkça toplam maliyet düşse bile kullanım dalgalanıyor.

Pratik çıkarım net: uzun bağlamlı ajan, RAG ve çok modlu asistan koşturan ekipler için V4.1 Flash, bellek ve prefill bütçesini ciddiye alan bir deneme adayı; donanımı olan için yerelde, olmayan için Lambda benzeri kiralık GPU'da test edilebilir. Kısa bağlamlı, düşük gecikmeli sohbet için kazanç daha sınırlı olabilir ve 'çok düşünen' yapısı gereği yanıt başına token hesabı yapılmalı. Açık ağırlık + açık makale, denemeyi düşük sürtünmeli kılıyor — karar öncesi kendi veri kümenizde ölçün, sonra ölçekleyin.

Kaynaklar

6 bağlantı; 2 tanesi 4 başka haberde de kullanılıyor. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.

deepseek · yapay zeka · kv cache · csa2 · moe · nodesdaily

Konuyu takip et

Bu haberden önce

Aynı olayla editör tarafından ilişkilendirilmiş önceki haberlerden kısa bir okuma sırası.

Kanıt ve kaynaklar

İzinli kaynak metnini, sürümünü ve köken bilgisini incele.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…