Gündeme dön

DeepSeek V4.1 Flash’ta Ayrılan Beyin: 890 Baytlık Notlarla Sınır Modellerine Meydan

10 Eylül 2026’da yayımlanan DeepSeek V4.1 Flash, küçük ve kısıtlı bir ekibin yazılım tarafında kurduğu ayrık mimariyle 1 milyon token bağlamı neredeyse düz bir maliyetle taşıyor; video derin incelemesi bu verim sıçramasını adım adım açıyor.

Nodesdaily’e aktarım: (UTC+03:00)
YouTube'da izle — MImgH4KMtj8
Okuma seçenekleri

Bu tarayıcıda cihazdan sesli okuma kullanılamıyor.

Kavram merceği

Bu görünümde geçen teknik kavramlardan birini seç. Genel tanımı, öğretici örneği ve haberdeki kullanımını birlikte oku.

Bu görünümde sözlüğümüzdeki kavramlardan biri bulunmadı. Sözlük henüz tüm terimleri kapsamıyor.

DeepSeek’in küçük bir Çin laboratuvarı olarak anılması artık klişe ama tablo hâlâ keskin: OpenAI ölçeğinde bütçe yok, ekip onlarca kat daha küçük, en yeni Nvidia hızlandırıcılarına tam erişim yok ve dev bir veri merkezi söz konusu değil. Buna rağmen 10 Eylül 2026’da duyurulan DeepSeek V4.1 Flash, şirketin yeni mimari ailesinin en küçük üyesi olarak tanıtılırken doğrudan sınır modelleriyle aynı lige yazılıyor. Modelin etiketindeki .1 sizi yanıltmasın; 552 milyar toplam parametreli karışım-uzman yapısı, önceki Flash sürümüne göre 2,5 kattan büyük ve V3 ile R1’i geride bırakıyor. İlginç olan büyüklüğün şişirilmiş bir kaynak faturası üretmemesi. Açık MIT lisansı, vLLM ve SGLang yolları ve Hugging Face’teki teknik raporla birlikte yayımlanması, iddianın kapalı bir demoyla sınırlı olmadığını gösteriyor.

Verim iddiasını anlamak için videonun kurduğu iki aşamalı çerçeveye bakmak gerekiyor. Her etkileşim önce okuma, sonra yazma olarak ayrılıyor. Okuma aşamasında istem ve ekli belgeler token’lara bölünerek model katmanlarından geçiyor ve her katman her token için iki sayı kümesi üretiyor: anahtarlar ve değerler. Bunların tümü KV önbelleği denen bir yığın oluşturuyor. Yazma aşaması ise yanıtı tek tek token üreterek örüyor ve her adımda bir sonraki olasılığı kestirmek için geriye dönüp bu yığına bakıyor. Yığın olmadan model her cümleyi sıfırdan hesaplamak zorunda kalır. Analoji net: haftalarca ders izleyip not tutan bir öğrenci, soruya yanıt verirken dersleri yeniden izlemez, masadaki notlara döner.

Sorun tam da bu notların şişmesi. Kısa bir istemde yığın küçük kalıyor ve GPU’ya bitişik yüksek bant genişlikli belleğe rahatça sığıyor. Fakat ajan senaryoları, saatlerce süren otonom görevler, dev kod tabanları ve çok belgeli bağlamlar gündeme gelince yığın odanın tamamını dolduruyor. Yüksek bant genişlikli bellek pahalı ve sınırlı bir masa yüzeyi gibi; dolunca taşma SSD gibi GPU dışındaki yavaş depolara gidiyor. Dosyaları koridordaki dolaba kaldırmak daha fazla yer açsa da her kelime tahmininde dolaba koşup dosyayı masaya getirmek gerekiyor. Bu taşıma, işlemcinin boş beklemesine yol açan asıl darboğaz. Video iki başlığı yan yana koyuyor: biri hesaplama bolluğu, diğeri hız kaybı. Masa doluysa hem bulmak zorlaşıyor hem de getirmek yavaşlıyor.

Geleneksel dönüştürücü mimarisinde her katman kendi notunu yazar. Token akışı katman katman ilerler, en olası bir sonraki token seçilir, çıktı geri eklenir ve döngü sürer. Her katmanın kendi KV yığını olduğu için toplam hacim katman sayısıyla birlikte şişer. DeepSeek V4.1 Flash burada beklenmedik bir makas atıyor. 40 katmanlık omurga ikiye bölünüyor: 20 katmanlı nedensel kodlayıcı ve 20 katmanlı kod çözücü. Kodlayıcı-teorisi YOCO’dan esinlenen bu ayrım, nokta güncellemesinden çok taban model değişimi gibi duruyor. Kodlayıcı okumayı üstlenirken kod çözücünün küresel yığın hesaplama yükü büyük ölçüde devreden çıkıyor.

Ayrımın çalışma mantığı sade. Okuma evresinde kod çözücünün ikinci yarısı neredeyse kapalı kalıyor; tüm ağır okuma işini ilk yarı yapıyor ve küresel KV yığını yalnızca kodlayıcıda üretiliyor. Yazma evresi başladığında kod çözücü, bağlamı yeniden okumak yerine kodlayıcının son katmanındaki gizli durumu ve buradan türetilmiş küresel yığını ödünç alıyor. İlk bakışta beynin yarısının dersi atlaması gibi görünüyor ve anlama riskini akla getiriyor. Video bu riski açıkça not ediyor: tasarım ancak çok hassas bir eğitim dengesiyle anlam kaybını önleyebiliyor. Kod çözücü küresel yığını kendisi hesaplamasa da tamamen kör değil; kayan pencere dikkat mekanizmasıyla en yakın token’lara odaklanarak yerel bağlamı kendisi kuruyor.

Küresel ve Yerel Bağlamı Ayırmak: Pencere ve Yönetici Analojisi

Küresel bağlam, isteme eklenen tüm belgeler ve uzun geçmişin tamamı demek; haftalarca ders notu gibi. Yerel bağlam ise yazılmakta olan cümlenin hemen çevresi, bir sonraki kelimeyi seçmek için gereken dar pencere. Kod çözücü küresel yığını yeniden üretmiyor, bunun yerine yalnızca son token’lara odaklanan kayan pencere dikkati kullanıyor. Video bunu şirket analojisiyle anlatıyor: kıdemsiz analistler binlerce sayfayı okuyup yoğun bir yönetici özeti çıkarıyor, kıdemli yöneticiler ise binlerce sayfayı yeniden okumadan özeti devralıyor ve imza aşamasında yalnızca önündeki sayfanın ifadesini büyüteçle inceliyor. Bu bölünme, modelin yarısının devasa küresel yığını üretme zorunluluğunu ortadan kaldırarak okuma için gereken hesaplama miktarını neredeyse yarıya indiriyor. Hesaplama kazancı, bellek tarafındaki şişkinliği tek başına çözmüyor; ikinci katman optimizasyon burada devreye giriyor.

En vurucu rakamlar bellek kesitinden geliyor. Token başına küresel KV boyutu DeepSeek V1’de yaklaşık 390 bin bayt iken V4.1 Flash’ta yalnızca 890 bayta iniyor; bu yaklaşık 437 kat küçülme demek. Bir önceki Flash sürümü 3.500 bayt civarındaydı, yani yeni sürüm ona göre de dört kata yakın daha sıkı. DeepSeek bunu Sıkıştırılmış Seyrek Dikkat 2, yani CSA2 ile başarıyor. Normalde her katman kendi notunu sıfırdan yazarken CSA2 aşırı paylaşım getiriyor. Her katman üç moddan birine atanıyor: Full katmanı kendi ana KV’sini ve arama için bir indeks tablosu oluşturuyor; Reindex katmanı aynı ana KV’yi yeniden kullanıp indeksin sorgu kısmını kendi bakış açısıyla yeniden puanlıyor; Reuse katmanı ise hem ana KV’yi hem de en son seçilmiş indeksleri hazır alıyor ve ek depolama üretmiyor. Aynı not defterini üç farklı içindekiler tablosuyla gezmek gibi düşünebilirsiniz: biri kronolojik, biri tematik, biri teknolojik sıçramalara göre; notlar aynı kalırken arama yolları çoğalıyor.

Paylaşım tek başına yetmiyor; hiyerarşik seyrek indeksleyici işi daraltıyor. Kod çözücünün ilk katmanı bir kapı bekçisi gibi tüm küresel notları tarıyor ve 1 milyon token içinden yalnızca yaklaşık 16 bin en ilgili konumu, yani 2.048 blok halinde 8’li grupları bir aday havuzuna alıyor. Sonraki tüm katmanların bu havuz dışını araması yasaklanıyor. Kulağa riskli geliyor; arama uzayını bu kadar daraltmak halüsinasyon yaratır mı? Video bu noktayı eğitim kalitesine bağlıyor: model aday havuzunu o kadar isabetli kuruyor ki sonraki katmanlar eksik bilgiyi neredeyse fark etmiyor. Yapı, 18 CSA2 kodlayıcı katmanında 2 sıkıştırma oranıyla üç altılı grup halinde, 20 kod çözücü katmanında ise 4’lü gruplar halinde statik olarak dağıtılıyor. Her katman kendi ana sorgusunu ve kayan pencere KV’sini korurken küresel yük paylaşılmış oluyor. Nicel sonuç, 1/4 HBM ve 1/8 SSD ihtiyacı gibi doğrudan faturalandırma kalemlerine yansıyor.

Bir başka radikal hamle kısa süreli belleği silmek. Kayan pencere dikkati, yerel bağlamı her turda SSD’ye yazıp geri okutuyor ve çok turlu sohbetlerde bu yazma trafiği depolamayı tıkıyor. DeepSeek’in yanıtı SWA sınırlı geri oynatma adını verdiği bir ters köşe: yerel belleği turlu saklamak yerine yanıt bitince tamamen silip yalnızca son 128 tokenlık pencereyi ihtiyaç anında sıfırdan yeniden hesaplatmak. İlk anda verimsiz görünüyor; dakikalarca anlattığı hesap tasarrufuna aykırı değil mi? Hesap tersine dönüyor. GPU üzerinden anakart yoluyla SSD’ye yazıp sonra geri çekmek, veriyi fiziksel olarak taşımak demek ve gecikmesi büyük. Oysa modern bir GPU için 128 tokenı yeniden hesaplamak mikro saniyelik bir işlem. Matematiği yeniden yapmak, veriyi koridordan taşımaktan daha hızlı ve daha ucuz kalıyor. Böylece hem hız artıyor hem de depolama alanı ciddi ölçüde boşalıyor.

Yardımcı Bileşenler: MHC, Engram ve DS-Spark

Ana gövdenin yanında üç yardımcı bileşen tabloyu tamamlıyor. İlki tek geçişli MHC; model çalışırken katmanlar arasında oluşan ara değerleri belleğe yazıp geri yükleme trafiğini azaltmak için ardışık işlemleri matematiksel olarak hizalayarak aynı anda koşturuyor. Milyarlarca kez tekrarlanan bu gidiş gelişler, tek tek küçük olsa da toplamda darboğaz oluşturuyor. İkincisi Engram; 168 milyar parametrelik ayrı bir hafıza modülü olarak pahalı GPU belleği yerine sunucunun standart RAM’inde duruyor ve durağan olguları, tarihleri, başkentleri, sabit bilgileri burada tutuyor. Video bunu kıdemli avukat ve yardımcısı benzetmesiyle veriyor: strateji avukatta kalırken net alıntı gerektiğinde yardımcı anında getiriyor. Üçüncüsü DS-Spark; modelin kelime kelime üretim zorunluluğunu kırarak birden fazla kelimeyi aynı anda üretebilmesini sağlıyor ve daha önce ayrı bir videoda detaylandırıldığı belirtilerek hız çarpanı olarak konumlanıyor.

Tüm parçalar birleştiğinde maliyet eğrisi şaşırtıcı biçimde düzleşiyor. Videoda atıf verilen ikinci şekilde y ekseninde işlem gücü, x ekseninde bağlam penceresi var. Standart 4 bin token’dan 1 milyon token’a, yani yaklaşık 700 bin kelimelik orta ölçek bir kod tabanı genişliğine çıkarken V4.1 Flash’ın çözme eğrisi neredeyse yatay kalıyor. Tek sayfalık belgeyle binlerce sayfa arasında kelime başına harcanan enerji benzer seviyede seyrediyor. Bu, ölçek büyüdükçe maliyetin de birlikte tırmandığı önceki nesillerin davranışını kırıyor. Donanım tarafında en iyi hızlandırıcılara sahip olmadan yazılımda derin optimizasyonla aynı etkiyi üretmek, videonun “imkansızı başardı” vurgusunun teknik karşılığı.

Performans tarafı da yalnızca verim hikayesi anlatmıyor. DeepSWE v1.1’de 74,2 puanla kapalı sınır modellerinden GPT6 Astra’nın 74’üyle başa baş, hatta bir adım önde görünüyor. Siber güvenlikte CyberGym’de 88,1’e karşı 84,5, otomasyon tezgahı AutomationBench’te 54,8’e karşı 50,3 ile öne geçerken Terminal-Bench 3.0’da 30’a karşı 43,3 ile geride kalıyor. LiveBench’te açık modeller arasında zirvede, Vals endeksinde bilgi işçiliği görevlerinde yine üst sıralarda anılıyor. Tasarım arenası gibi tek bir üçüncü taraf ölçümünde GPT6 Astra’nın ortalamasının %98’ine ulaşırken görev başına maliyeti 1,61 dolardan 0,023 dolara, yani yaklaşık %1,4’e iniyor ve süreyi 11,1 dakikadan 5,3 dakikaya çekiyor. Çıktı hızı saniyede 200 tokenı aşıyor ve ilk yanıta geçiş süresi sektörün en düşükleri arasında gösteriliyor. Aynı raporda en zor bilimsel ajan görevlerinde hâlâ dev kapalı modellerin gerisinde kalındığı da açıkça not ediliyor.

Toparlamak gerekirse V4.1 Flash tek bir buluşun ürünü değil, bir dizi uyumlu tasarım kararının bileşkesi. Kayan pencere dikkatiyle dar bir yerel odak, beyni ikiye ayırarak okuma hesabını yarıya indiren kodlayıcı-kod çözücü yapısı, Full/Reindex/Reuse üçlüsü ve hiyerarşik aday havuzuyla 437 kata varan KV sıkıştırma, 128 tokenlık sınırlı geri oynatmayla silinen kısa süreli bellek, trafiği azaltan MHC, durağan bilgiyi RAM’e taşıyan Engram ve çok kelimeli üretim yapan DS-Spark aynı potada buluşuyor. Sonuç, yalnızca HBM’de 4 kat ve SSD’de 8 kat daha az yer isteyen değil, aynı zamanda 45 trilyon token üzerinde eğitilmiş, 384 bin maksimum çıktıyı destekleyen, düşük-yüksek-maksimum akıl yürütme kademeleri sunan mille bağlamlı bir ajan altyapısı. Açık ağırlıklarla yayımlanması ve DeepSeek API’de deepseek-flash adıyla canlıya alınması, bu Frankenstein verim canavarının laboratuvar dışına çıkıp gerçek kod tabanlarında sınanacağı anlamına geliyor.

Görsel: nodesdaily AI

V4.1 Flash Seçili Skorlar

  • CyberGym88.1
  • DeepSWE v1.174.2
  • AutomationBench54.8
  • Terminal-Bench30.0
Yüksek puan daha iyi; güvenlik ve mühendislikte zirve.
TezgahV4.1 FlashEn iyi rakip
DeepSWE v1.174.274.0
CyberGym88.184.5
AutomationBench54.850.3
Terminal-Bench 3.030.043.3

Videodaki anahtar anlar

  1. Giriş — kısıtlı kaynakla sınır hedefi
  2. KV önbelleği: masa ve dolap analojisi
  3. Ayrık beyin: kodlayıcı ve kod çözücü bölünmesi
  4. CSA2 ve paylaşım: üç mod ve indeks tablosu
  5. Kapı bekçisi ve aday havuzu: 1 milyondan 16 bine
  6. SWA sınırlı geri oynatma: 128 tokenı yeniden hesapla
  7. MHC, Engram, DS-Spark ve yatay maliyet eğrisi
  8. Skorlar, hız ve maliyet: açık ağırlıklarla kapanış

AI yorumu

"Beni en çok çarpan nokta donanım yarışını reddedip yazılımı sıkılaştırma fikri oldu; 390 bin bayttan 890 bayta inen notlar, lüks bir kampüsü değil akıllı bir dosyalama sistemini anlatıyor ve bunu açık ağırlıklarla paylaşmaları güven veriyor."

AI değerlendirmesi

Karşıt görüşü en güçlü haliyle kurarsak tablo daha temkinli okunur: Yazılım odaklı sıkıştırma ve paylaşım, bellek faturası ve gecikme üzerinde etkileyici olsa da akıl yürütme derinliği ve nadir alan bilgisi her zaman verimle aynı ölçekte iyileşmiyor. Video kendi içinde de kabul ediyor: en zor bilim odaklı ajan görevlerinde dev kapalı modeller hâlâ önde. Eğer değerlendirme yalnızca ajan kodlama ve otomasyon tezgahlarıyla sınırlı kalırsa, modelin geneline dair iyimser çıkarım fazla genellenmiş olur. Ayrıca maliyet avantajı tek bir tasarım arenası fiyatlamasına yaslanmamalı; görev türü, tekrar sayısı ve sağlayıcı fiyat politikası değiştiğinde %1,4 gibi çarpıcı oranlar da oynayabilir.

Metodoloji sınırları ve eksik yönler de not edilmeli. Eğrinin düzleşmesi bağlam başına maliyeti değil kelime başına ortalama çözme maliyetini anlatıyor; toplam fatura hâlâ bağlam büyüdükçe artıyor, sadece daha yavaş artıyor. KV sıkıştırma oranları FP4 kuantizasyonu ve eğitim sırasında kuantizasyon farkındalığıyla birlikte geliyor; bu, niceliksel kazancı korurken sayısal hassasiyetin uzun zincirlerde nasıl davrandığına dair ek doğrulama gerektiriyor. 1 milyon tokenlık aday havuzu 16 bine indirme kararı, havuz doğruluğuna bağımlı; eğitim verisinin dışındaki sıra dışı dağılımlarda isabetin düşmesi, sonraki katmanların telafisini zorlaştırır. Sınırlı geri oynatma 128 token penceresinde çok ucuz ama diyalog tarihi tamamen silinmiş bir durumda uzun referans zincirlerinin kopma riski, ürünleşmiş ajanlarda ek test ister.

Çıkar ve doğrulanabilirlik açısından anlatı büyük ölçüde DeepSeek’in teknik raporu ve tek bir videonun yorumuna dayanıyor; bağımsız tekrar testleri özellikle hız, ilk token gecikmesi ve maliyet kalemlerinde varyans gösterebilir. Puanlar birden fazla kaynaktan teyit edilebiliyor: 552B toplam, 8B önyükleme ve 16B çözme aktif parametreleri, 1 milyon token bağlam, 890 bayt küresel KV, HBM’de 1/4 ve SSD’de 1/8 oranları hem resmi duyuruda hem de Meta AI Labs ve The Decoder özetlerinde tekrarlanıyor. Ancak “sınır modeliyle eşdeğer” ifadesi tezgaha göre değişiyor; DeepSWE ve CyberGym’de güçlü, Terminal-Bench’te geride olan tabloyu tek bir manşet skoruna indirgemek isabetsiz olur. En sağlam kullanım, kendi iş yükünüzde vLLM veya SGLang yoluyla aynı istemlerle ölçüm tekrarlamaktır.

Pratik çıkarım, her ekip için aynı değil. Uzun bağlamlı ajanlar, büyük kod tabanları ve çok turlu araç çağrılarıyla çalışan ekipler için V4.1 Flash cazip bir varsayılan; bellek ve maliyet tasarrufu doğrudan yineleme bütçesine yansıyor ve açık ağırlıklar yerel denemeye izin veriyor. İlk yanıt hızının kritik olduğu ürünler için 200 token/s ve düşük ilk gecikme iddiası da anlamlı. Buna karşılık, çok niş bilimsel hesaplama, formel doğrulama veya Terminal-Bench tarzı uzun terminal dizileri içeren işlerde dev kapalı modellerin hâlâ referans olarak tutulması gerekiyor. Ara katmanda kalan projelerde düşük, yüksek ve maksimum akıl yürütme kademelerini aynı görevde yan yana koşup maliyet-kalite eğrisini kendiniz çizmeniz en sağlıklı yol; verim tek başına değil, sizin alanınızdaki doğrulukla birlikte değer kazanıyor.

Kaynaklar

7 bağlantı; 3 tanesi 4 başka haberde de kullanılıyor. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.

yapay zeka · deepseek · v4.1 · flash · ayrılan · beyin · nodesdaily

Konuyu takip et

Bu haberden önce

Aynı olayla editör tarafından ilişkilendirilmiş önceki haberlerden kısa bir okuma sırası.

Kanıt ve kaynaklar

İzinli kaynak metnini, sürümünü ve köken bilgisini incele.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…