Büyük işler genelde model bilgisiz olduğu için değil, cevap yarıda kesildiği için dağılıyor. Sunucu, aylardır yeni bir amiral gemisi bekleyen geliştiricilerin hikayesiyle açılıyor: hızlı ve ucuz Flash modeller gündelik işleri taşıyor, ama zorlu görevlerde sınırda kalan bellek ve kopan bağlam can sıkıyor. İddia büyük: Argon kod adlı deneysel model tek yanıtta 1 milyon token üretebiliyor ve bu, bugünkü sınırların yaklaşık sekiz katı demek. Bu yazıda bu sayıyı olduğu gibi kabul etmiyor, neyin konuşmacı iddiası neyin bağımsız veri olduğunu ayırarak ilerliyorum.
Önce bağlamı netleştirelim. Anlatıcı, Google'ın ilkbahardaki Gemini 3.1 Pro sürümünden sonra uzun süre yalnızca Flash varyantları yayınladığını, geliştiricilerin ise Claude ve GPT karşısına çıkacak güçte bir model beklediğini söylüyor. Bu kısım kayda değer biçimde gerçek veriyle örtüşüyor: Artificial Analysis (artificialanalysis.ai) sitesindeki güncel model kartı Gemini 3.1 Pro Preview sürümüne 30 puan veriyor ve bağlam penceresini 1 milyon token olarak listeliyor. Sunucunun 53 puan ve bir önceki nesle göre 23 puan sıçrama iddiası ise yalnızca videoya ait, bağımsız kartta böyle bir Argon kaydı bulunmuyor. Dağıtım planı da aynı temkinle okunmalı: önce siber güvenlik ortakları ve güvenilir testçiler, sonra ücretli API ve Ultra aboneleri. Benzer kademeli açılışları daha önce de gördük, çünkü uzun koşular ciddi işlem gücü istiyor.
Çıkış sınırı neden ajan işlerini bölüyor
Çıkış sınırı ile bağlam penceresi sık karıştırılıyor, oysa farklı şeyler. Bağlam penceresi modelin okuyabildiği toplam girdi, çıkış sınırı ise tek yanıtta yazabildiği maksimum üretim. Sunucunun aktardığına göre önceki Google modelleri 64 bin, Opus 5.5 ve GPT-6 Astra tarafı 128 bin dolayında duruyor. Bu noktada bağımsız bir dayanak var: ClaudeLab (claudelab.net) sitesindeki güncel kılavuz, Opus 4.6 ve Sonnet 4.6 sürümlerinde 128 bin çıkış desteğini adım adım anlatıyor. Yani 128 bin eşiği sektörde gerçek bir çıpa, 1 milyon ise henüz yalnızca videodaki Argon iddiası olarak duruyor. Modeller otoregresif üretim yaptığı için, yani her yeni parçayı öncekilere bakarak yazdığı için, sınırın ortasında kalan işi ajan özetleyip yeni yanıtta sürdürmek zorunda kalıyor.
Bu bölünme masum bir devam düğmesi değil. Ajan duruyor, o ana kadarki işi özetliyor ve taze bir yanıt açıyor; her aktarımda değişken adları, daha önce alınan kararlar ve tekil sınır durumları biraz daha silikleşiyor. Sunucu üç somut alanı sayıyor: yüzlerce dosyaya aynı dikkatli değişikliği uygulayan kod migrasyonları , bütün kod tabanına tutarlı test yazımı ve okuyup akıl yürütüp uzun belge üreten derin araştırma raporları. Bunlar kulağa abartı gelmiyor, çünkü gerçek ekiplerin günlük şikayeti aynı: parça parça ilerleyen işlerde tutarlılık kaybı. Anlatıcının verdiği video kodlayıcı örneği ise iddia düzeyinde kalıyor: yaklaşık 32 bin satırlık el yazımı düşük seviye kodun değiştirilip 2,7 kat hızlandığı söyleniyor, fakat ortada tekrarlanabilir bir rapor yok.
Mühendislik bedeli: hata birikimi ve bellek
Uzun çıkışın neden her laboratuvarın vitrinine girmediğini anlamak için iki engeli görmek gerekiyor. Birincisi hata birikimi : her adım neredeyse doğru olsa bile yüzlerce adım üst üste binince tamamının doğru kalma olasılığı hızla düşüyor, sunucu bunu yüzde 99 adım güvenilirliği üzerinden sade bir olasılık hesabıyla gösteriyor. İkincisi bellek: yazılan her parça, sonraki parça üretilirken hatırlanmak zorunda, yanıt uzadıkça adım başına bellek ihtiyacı büyüyor. Bu etkinin ciddiye alındığını akademik cephe de doğruluyor: arXiv (arxiv.org) üzerindeki güncel önbellek ve uzun üretim çalışmaları, anahtar-değer önbelleğinde biriken küçük sapmaların uzun dizilerde kaliteyi nasıl düşürdüğünü ölçüyor. Google tarafının resmi çerçevesi için DeepMind (deepmind.google) sitesindeki Gemini 3.1 Pro model kartı, yeteneklerin yanında sınırlılık ve güvenlik değerlendirmelerini açıkça listeliyor ve uzun bağlam iddialarını bu çerçeveyle okumayı öğütlüyor.
Sunucunun aktardığı mühendislik çözümü kulağa mantıklı geliyor: çok uzun yanıt duraklatılıp sonraki çağrılarda kaldığı yerden sürdürülüyor, böylece zaman aşımı işi öldürmüyor. Buna uzun kod çözme sürdürme adını veriyor. Saniyede yaklaşık 100 token hızla tam 1 milyon token yazmak üç saate yakın sürerdi, yani bu yapı hızlı hata düzeltme için değil, haftalar sürecek titiz mühendislik işleri için tasarlanmış. Burada önemli bir beklenti ayarı var: daha uzun yazabilmek daha hızlı bitirmek demek değil, daha az bölünerek bitirmek demek. Hız tarafında bağımsız veri yine Artificial Analysis kartından geliyor: Gemini 3.1 Pro Preview sürümü saniyede 115 token ile hızlılar arasında, yani altyapı tarafı uzun koşuya hazır görünüyor.
Skor tablosu: hangi test neyi ölçüyor
Karşılaştırma bölümü en dikkatli okunması gereken yer, çünkü her sayı aynı kefeye konamaz. Sunucuya göre Argon, gerçek dünya yazılım mühendisliği testinde 77,9 ile rakiplerinin 74 bandındaki skorlarını geçiyor, otomasyon bençinde birinci oluyor ve insan oyuna dayalı Arena metin sıralamasında zirvede. Buna karşılık Frontier SWE ve terminal tabanlı kodlama testlerinde Opus tarafının gerisinde kalıyor. Bu tabloyu yorumlamak için test okuryazarlığı şart: Dreaming Press (dreaming.press) sitesindeki güncel rehber, kodlama skorunun model artı iskelet skoru olduğunu, yani aynı modelin farklı ajan düzeneklerinde çok farklı sonuç verebileceğini vurguluyor. Bu uyarıyı arXiv (arxiv.org) üzerindeki iskelet etkisi çalışması da destekliyor: düzenek seçimi gizli bir değişken gibi davranıyor. İnsan tercihi cephesinde LMArena (lmarena.ai) sitesindeki metin sıralaması, milyonlarca oyla oluşan canlı bir tablo sunuyor ve tek bir zirve iddiasını oradaki dağılımla birlikte okumak gerekiyor.
Halüsinasyon bölümü videonun en heyecanlı, ama aynı zamanda en yanlış anlaşılmaya açık kısmı. İddia şöyle: Argon yüzde 15 halüsinasyon oranıyla ölçülmüş en düşük değerlerden birini alıyor, rakip Astra yüzde 51 dolayında kalıyor. Fakat aynı testte doğruluk skorları tersine dönüyor, Argon 50, Astra 63 alıyor. Yani model daha bilgili olduğu için değil, bilmediğinde susmayı seçtiği için öne çıkıyor. Mühendislik pratiğinde bu ayrım altın değerinde, çünkü uydurma bir API veya var olmayan bir kütüphane saatler kaybettiriyor. Dürüst bir bilmiyorum, kendinden emin yanlıştan ucuz. Yine de bu oranlar yalnızca videonun aktardığı ölçümler; bağımsız halüsinasyon liderlik tablolarında Argon adında bir kayıt yok, o yüzden rakamları konuşmacı iddiası etiketiyle taşıyorum.
Fiyat, önbellek ve denemeden önce hazırlık
Fiyat tarafı ilk bakışta agresif: milyon token başına 2 dolar girdi, 10 dolar çıkış ve önbelleğe alınmış girdide yüzde 90 indirim. Bu yapı gerçek dünyadaki kartlarla uyumlu: Artificial Analysis (artificialanalysis.ai) kartı Gemini 3.1 Pro Preview için aynı 2 dolar girdi fiyatını ve yüzde 90 önbellek indirimini yazıyor. Önbellek mekaniğinin kendisi de belgeli: Claude (platform.claude.com) belgeleri, uzun bağlam işlerinde önbelleğin nasıl kurulduğunu ve tam eşleşme gerektirdiğini açıklıyor. Sunucu, tanıtım fiyatının sonra yükseleceğini ve görev başına maliyetin jeton başına fiyattan daha önemli olduğunu söylüyor; aktardığı 62 bin ve 27 binlik görev başına jeton tüketimleri yine yalnızca videoya ait. Denemek isteyenler için önerdiği dört adım sağduyulu: mevcut modelin zorlandığı tek bir uzun görev seç, önbelleği aç, API anahtarına harcama limiti koy, her görevde süre ve jeton tüketimini izle. Ben bir beşincisini ekliyorum: aynı görevi kullandığın modelle yan yana koş, kazananı lafa değil ölçüme bırak.
| Konu | Özet |
|---|---|
| Çıkış iddiası | Tek yanıtta 1 milyon token, bağımsız kaydı yok |
| Neden önemli | Bölünmeden biten uzun ajan koşuları |
| Maliyet kuralı | Önbellek ve görev başına ölçüm şart |
Videodaki anahtar anlar
- 7 aydır amiral gemisi yok, Argon iddiası açılıyor
- Neden önemli: bölünmeden biten uzun işler
- 1 milyon çıkış ve 8 kat iddiası
- Otoregresif yazım ve bağlam kaybı
- Migrasyon, test ve araştırma örnekleri
- Video kodlayıcı ve 2,7 kat hız iddiası
- Skor tablosu: Deep Suite ve Arena iddiaları
- Halüsinasyon ve doğruluk ayrımı
- Fiyat, önbellek ve hazırlık adımları
AI yorumu
"Benim icin bu videonun degeri sayisal iddialardan cok soruyu dogru koymasi: mesele daha uzun cevap degil, ayni isin tek ve tutarli kosuda bitmesi. Bagimsiz dogrulama olmadan 1 milyon rakamini temkinle karsiliyor, ama bellek ve maliyet kismini ciddiye aliyorum."
AI değerlendirmesi
En güçlü itirazla başlayayım: 1 milyon token kulağa etkileyici geliyor, ama çoğu ekip için asıl darboğaz yazma uzunluğu değil, bekleme süresi ve fatura. Üç saatlik tek yanıt, deneme-yanılma döngüsünü öldürür; gündelik kodlamada hızlı ve isabetli küçük model çoğu zaman dev ama yavaş modelden pratiktir. Sunucunun kendisi de bunu itiraf ediyor: terminal testlerinde Opus tarafı önde. O yüzden bu model her işin değil, bölünmeye tahammülü olmayan az sayıda uzun işin adayıdır.
Eksik kalanlar listesi kısa değil. Ortada bağımsız bir Argon kaydı yok: ne Artificial Analysis tablosunda, ne DeepMind model kartında, ne de LMArena sıralamasında böyle bir sürüm görünüyor. Fiyat tarafındaki tanıtım indirimi ne zaman bitecek, kademeli erişim ne kadar sürecek, bellek ve işlem gereksinimleri nedir, video kodlayıcı örneğinin tekrarlanabilir ölçümü nerede, bunlar yanıtsız. Ayrıca benchmark okuryazarlığı uyarısını tersine de işletmek gerekir: Argon lehine görünen her zirve de bir düzenek artı model skorudur, rakip lehine olanlar kadar temkinle okunmalıdır.
Konuşmacının çıkarı açısından tablo temiz sayılır: uygulamalı model incelemeleri yapan bir kanal, abone ve izlenme karşılığında derinlemesine test vadediyor, doğrudan bir satış bağı görünmüyor. Yine de seçici vurgulama riski var; heyecan veren bölümler öne çıkarken, fiyat artışı ve bekleme süresi gibi soğutan detaylar hızla geçiliyor. Okur için pratik çıkarım net: uzun bir migrasyon veya refactor işin varsa bekle ve ölç, yoksa bugün kullandığın modeli değiştirmek için acelen yok. Benim kararım da bu: iddiayı not et, bağımsız kayıt düşene kadar mimari dersi al, paranı değil vaktini ayır.
Kaynaklar
8 bağlantı; 1 tanesi 1 başka haberde de kullanılıyor. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.
- @youtube YouTube — NetworkCoder
- @artificialanalysis.ai Artificial Analysis Gemini 3.1 Pro model card
- @deepmind.google Google DeepMind Gemini 3.1 Pro model card
- @claudelab.net ClaudeLab 128K output tokens guide
- @platform.claude.com Claude prompt caching documentation
Aynı kaynağı kullanan: Opus 5.5'in %40 daha ucuz iddiası ve GPT-6 ile kumaş simülasyonu: 20 dakikada gerçekçi fizik neden öne geçti
- @dreaming.press Dreaming Press coding benchmark reading guide
- @lmarena.ai LMArena text leaderboard
- @arxiv.org arXiv harness effect in agentic evaluation
yapay zeka · kodlama ajanlari · uzun baglam · benchmark · onbellek · halusinasyon