DeepSeek 10 Eylül'de V4.1 Flash'i resmen çıkardı: 552 milyar parametreli, 1 milyon token bağlamlı, MIT lisanslı açık ağırlıklı bir model. API'deki adı deepseek-flash; eski v4-flash adları artık bu modele yönleniyor. Şirketin iddiası büyük: skorlar bir önceki neslin kapalı devleri Opus 5 ve GPT-5.6 Sol ile aynı ligde. Video da bu yüzden altı aylık ritmi hatırlatıyor: önce frontier koşuyor, yarım yıl sonra açık modeller aynı seviyeyi yakalıyor, altı ay sonra da bu güç yerel makinelere iniyor.
Şirketin yayımladığı tabloda öne çıkanlar şöyle: yazılım mühendisliğinde DeepSWE v1.1'de 74,2 ile Opus 5'in 74,0'ını kıl payı geçiyor; siber güvenlikte CyberGym'de 88,1 alıyor; otomasyonda AutomationBench'te 54,8 yapıyor. Ama tablo tek yönlü değil: Terminal-Bench 3.0'da 30,0'da kalıp Opus 5'in 43,3'ünün gerisine düşüyor. Üçüncü parti bir tasarım arenasında ise Astra'nın skorunun yüzde 98'ine ulaşıp görev başına 2,3 sent harcıyor; Astra aynı işi 1,61 dolara yapıyor.
Mimari tarafı işin en ilginç kısmı. Model 40 katmanlı yeni bir kodlayıcı-kodçözücü iskelete sahip: 20 katman girdiyi okuyor, 20 katman üretim yapıyor. Girdi okunurken token başına yalnızca 8 milyar, üretim sırasında 16 milyar parametre çalışıyor; 552 milyarın geri kalanı o an uyuyor. Uzmanlar-karışımı denen fikir tam da bu: soruyu hangi mini-uzmanın cevaplayacağına karar verip işi ona yıkmak. Sıkıştırılmış seyrek dikkat mekanizması da uzun metinlerin maliyetini ayrıca kısıyor.
Hız iddiası videoda canlı deneniyor: bin kelimelik bir deneme yaklaşık 6 saniyede akıyor, yani saniyede 200 token mertebesi. Anlatıcı bunu ilk günlerin Groq heyecanına benzetiyor; model bir önceki amiral V4 Pro'dan da hızlı çalışıyor. Sürekli girdi okuyan ajan iş yükleri için bu tempo, ham skordan bile önemli olabilir; çünkü maliyet kadar bekleme süresi de faturaya yazılıyor.
Bellek tarafındaki kazanım daha da çarpıcı. Modelin bağlam önbelleği, selefine göre hızlı bellekte dörtte bir, SSD tarafında sekizde bir yer kaplıyor. Şirketin V1 ile kıyası dudak uçuklatıyor: token başına önbellek 437 kat küçülmüş. Uzun bağlamla adım adım çalışan ajanlar için bu, daha az ekran kartı belleği ve daha düşük sunucu faturası demek.
Bu hamle bir krizin ortasına denk geliyor. HBM3E spot fiyatlarının uzun vadeli kontratların 4-5 katına çıktığı, Samsung'un kapasitesinin yüzde 70'ini 2031'e kadar kilitlediği konuşuluyor. Reuters 10 Eylül'de Çinli çip üreticilerinin bellek zammı yüzünden işlemci fiyatlarını artırdığını yazdı. Telefon ve bilgisayarların pahalanıp belleklerinin kırpılması da aynı yangının dumanı; DeepSeek cevabı algoritmada arıyor.
Fiyat listesi saldırgan: yoğun saat dışında milyon girdi tokenı 15 sent, yoğun saatte 30 sent. Önbellekten gelen girdi neredeyse bedava: milyonda 0,3 sent. Üretim tarafı milyonda 60 sent ile 1,20 dolar arasında. Şirket, firmaları ekran kartlarının boş kaldığı saatlere çekmek için bu çift tarifeyi kullanıyor. Ağırlıklar açık olduğu için kimse verisini DeepSeek'e vermek zorunda da değil.
Videonun ekonomi tezi net: en doğru cevabın bedeliyle iş gören cevabın bedeli arasında katlarca fark var; kapalı frontier milyon token başına 50 dolar mertebesindeyken burada kuruşlar konuşuluyor. İnternet siteleri ve PDF işleri gibi hacimli işlerin yüzde 95'i için bu sınıf fazlasıyla yetiyor. Üstelik şirket tekniği bir raporda açık açık anlatıyor; bir startup bu metinden kendi modelini türetebilir.
Ama test masası tablo kadar cömert değil. Rubik's küpü benzetimi 12 saniyede yazılıyor, ilk bakışta düzgün görünüyor; karıştır düğmesine basınca renkler hareketten değil, kendiliğinden değişmeye başlıyor. Çöz düğmesi ise gerçek bir çözüm üretmiyor, hamleleri tersten oynatıp başlangıca dönüyor. Aynı sonuç hem şirketin sitesinde hem Codex üzerinden alınıyor; anlatıcı bir buçuk yıldır hiçbir modelde böyle bir çöküş görmediğini söylüyor.
İki test daha var. Ekibin Paintbench denemesinde model, referans portreyi soyut ve detaysız bir çalışmaya dönüştürüyor; Astra'nın katman katman fırça tekniğinden eser yok. Sudan geçen merminin 3D benzetimi ise iyi bir uygulama kabuğunun içinde vasat bir fizik sunuyor. Hüküm adil: ucuz, hızlı ve verimli bir iş beygiri; ama GLM 5.3'ten iyi mi sorusu başka bir videoya kalıyor.
Tasarım görev maliyeti: 2 sent vs 1,61 dolar
- V4.1 Flash$0.023
- GPT-6 Astra$1.61
| Benchmark | V4.1 Flash | En iyi rakip |
|---|---|---|
| DeepSWE v1.1 | 74,2 | 74,0 (Opus 5) |
| CyberGym | 88,1 | 84,5 |
| Terminal-Bench 3.0 | 30,0 | 43,3 (Opus 5) |
AI yorumu
"Benim okumam şu: bu sürüm, açık modellerin altı ay geriden gelme ritmini koruduğunu kanıtlıyor; asıl haber benchmark değil, bellek faturasını küçülten mimari. Rubik's küpü fiyaskosu da bu sınıfın sınırını dürüstçe çiziyor."
AI değerlendirmesi
Karşıt görüşü en güçlü haliyle kuralım: bu skorlar şirketin kendi raporundan. Lansman günü bağımsız bir ölçüm yoktu; Artificial Analysis henüz test etmemişti, Hugging Face sayfasında modeli sunan sağlayıcı görünmüyordu. Terminal-Bench 3.0 gibi tablolarda Opus 5 açık ara önde. Yani 'frontier seviyesi' hükmü, seçilmiş tabloların üstünde duruyor; doğrulanmamış bir iddia olarak okunmalı.
Videonun kendi testleri de tek denemelik, tek promptluk gösterimler; genelleme taşımıyor. Daha önemlisi, sınırları şirketin kendisi çiziyor: en zor bilim odaklı ajan görevlerinde ve görüntü analizinde dev modellerle fark sürüyor. Exploit Gym'de 15 gibi sönük bir skor da tablonun süpürülmüş köşesi. Eğlence testlerindeki çöküş, bu sınırların habercisi olabilir.
Doğrulanabilirlik tarafında iki uyarı var. Birincisi, '.1' numarası bir makyaj izlenimi veriyor; oysa ortada yeni bir baz model ve emekli edilen 1,6 trilyonluk bir amiral var. İkincisi, fiyatlar yoğun-saat-dışı tarifeye göre parlatılıyor. Karar anında kendi iş yükümü yoğun saat fiyatıyla ve bağımsız ölçümlerle test etmeden hüküm vermem.
Benim pratiğim şöyle şekillendi: uzun bağlamlı ajan işlerinde ve bellek kısıtlı kurulumlarda bu model ilk denenecek aday; nihai doğruluğun parayla satın alındığı kritik işlerde kapalı frontier hâlâ tahtta. Fiyat etiketine değil, kendi ölçümüme bakacağım; açık ağırlıklar da bu ölçümü risksiz kılıyor.
Kaynaklar
10 bağlantı; 5 tanesi 5 başka haberde de kullanılıyor. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.
- @YouTube Matthew Berman — bölüm videosu
- @deepseek.com https://www.deepseek.com/en/news/deepseek-v4-1-flash/
Aynı kaynağı kullanan: DeepSeek V4.1 Flash'in Çılgın Mimarisi: Paylaşımlı Hafızayla 437 Kat Küçülen KV · DeepSeek V4.1 Flash’ta Ayrılan Beyin: 890 Baytlık Notlarla Sınır Modellerine Meydan · DeepSeek V4.1 Flash Pro Tarafının Yerine Geçiyor: Asimetrik Tasarım Cephe Ajan Yarışına Giriyor · Yapay Zeka Tier Listesi Sıfırlandı: GPT-6 Astra Zirvede, Abonelik Matematiği Dengeleri Değiştirdi
- @venturebeat.com https://venturebeat.com/technology/deepseek-v4-1-flash-debuts-with-0-003-1m-off-peak-cached-input-rate-and-benchmarks-eclipsing-gpt-5-6-sol-claude-opus-5
Aynı kaynağı kullanan: Korkutan Uyarılar, Yeni Modeller ve Katlanabilir iPhone Haftası
- @orcarouter.ai https://www.orcarouter.ai/blog/deepseek-v4-1-new-base-model
Aynı kaynağı kullanan: DeepSeek V4.1 Flash Pro Tarafının Yerine Geçiyor: Asimetrik Tasarım Cephe Ajan Yarışına Giriyor
- @the-decoder.com https://the-decoder.com/new-deepseek-model-v4-1-flash-cuts-memory-needs-for-ai-agents/
Aynı kaynağı kullanan: DeepSeek V4.1 Flash’ta Ayrılan Beyin: 890 Baytlık Notlarla Sınır Modellerine Meydan
- @beam.ai https://beam.ai/agentic-insights/deepseek-v4-1-flash-ai-agents
Aynı kaynağı kullanan: DeepSeek V4.1 Flash’ta Ayrılan Beyin: 890 Baytlık Notlarla Sınır Modellerine Meydan
- @reuters.com https://www.reuters.com/world/asia-pacific/chinas-ai-chipmakers-raise-prices-high-bandwidth-memory-shortage-bites-2026-09-10/
- @trendforce.com https://www.trendforce.com/news/2026/09/01/news-hbm3e-spot-prices-said-to-be-4-5x-lta-levels-with-samsung-reportedly-locking-70-of-memory-capacity-through-2031/
- @spectrum.ieee.org https://spectrum.ieee.org/dram-shortage
- @datanorth.ai https://datanorth.ai/news/deepseek-releases-deepseek-v4-1-flash
deepseek · v4.1 flash · açık ağırlık · moe · benchmark · hbm · yapay zeka