Yapay zeka dünyasında bir hafta kaçırmak bile yeni bir model kuşağını arkada bırakmaya yetiyor ve Google tam da bu hız baskısının ortasında Gemini 4 Argon'u duyurdu. Adı Tolkien hayranlarının Aragorn kinge gönderme olarak okuduğu bu yeni amiral gemisi, Blog Google duyurusuna göre şu anda yalnızca DeepMind'ın Fairwind Programı kapsamında seçilmiş siber güvenlik ortaklarına ve güvenilir test kullanıcılarına açık durumda; geniş erişim ise önce ücretli API müşterilerine ve Google AI Ultra abonelerine, ardından genel kitleye kademeli olarak yayılacak.
Konuşmacı bu modeli izlerken dikkatini en çok çeken noktanın fiyat olduğunu vurguluyor ve bunun haksız bir coşku olmadığı Blog Google'ın fiyatlandırma tablosundan anlaşılıyor: tanıtım süresince milyon giriş tokenı başına 2 dolar, milyon çıkış tokenı başına 10 dolar ücret talep ediliyor ve önbelleğe alınan giriş tokenları yüzde 95 indirimle faturalanıyor. Tanıtım dönemi bittiğinde ise rakamlar 4 ve 20 dolara yükseliyor; bu haliyle bile model, benzer yetenek seviyesindeki rakiplerinin altında konumlanıyor.
Daha da çarpıcı olan, Google'ın maksimum çıktı limitini 64 binden tam 1 milyon tokena sıçratması. Bu sıçrama, uzun süreli ve çok adımlı görevlerde modelin tek bir akış içinde yüz binlerce token üretebilmesi anlamına geliyor; bir araştırma raporunu bölmeden, bir kod tabanını parçalamadan düşünebilen bir araç demek. Düşük gecikme varyasyonuyla birleştiğinde, bu özellik Argon'u gündelik yoğun kullanımda güçlü bir aday haline getiriyor.
Konuşmacının net kanaati şu: Argon en iyi kod yazan model olmayabilir, fakat metinsel bilgi işi denildiğinde masadaki en iddialı kartlardan biri. Sunumda GPT-6 Astra, Fable 5.1 ve hatta Opus 5.5'in bilişsel işçilik tarafında geriye düştüğü; Argon'un 1 milyon token bağlam penceresiyle yüz binlerce tokenı tek seferde sindirip işleyebildiği anlatılıyor. Bu, kitap boyutundaki doküman setlerini ya da dev kurumsal kayıtları tek pass'ta değerlendirmenin önünü açıyor.
Ölçüm Tablolarında Yeni Liderler
Kanıt olmadan övünmek her tanıtımın huyudur, fakat burada tablo oldukça kalabalık. DeepSWE v1.1 ölçümünde yüzde 77.9 ile gerçek dünya yazılım mühendisliğinde yeni bir zirve gören model, finans-kodlama-hukuk-vergi işlerini ABD GSYİH ağırlığıyla toplayan Vals endeksinde de lider konumda. Zapier'ın uçtan uca iş süreçlerini ölçen AutomationBench'inde yüzde 51.3 ile birinci sırada; uzun video anlama tarafında ise arXiv üzerinde yayımlanan LVBench makalesinin tanımladığı zorlu testte yüzde 91.7 ile rekor kırıyor.
Maliyet-etkinlik tarafında hikaye daha da daralıyor. artificialanalysis.ai analizine göre Argon, Zeka Endeksi'nde 53 puan alarak GPT-6 Astra ile aynı seviyeye yerleşiyor ve GPT-6.1 Sol'ün bir puan önünde duruyor; görev başına maliyeti ise 1.99 dolar, yani Astra'nın 3.26 dolarlık tablosunun yalnızca yüzde 60'ı. En ilginç bulgu ise halüsinasyon oranı : yüzde 45 ve üzeri puan alan modeller arasında yüzde 15 ile şimdiye dek ölçülmüş en düşük değer; karşılaştırma için Astra yüzde 51, Sol yüzde 54 civarında seyrediyor.
Agentic performans diye adlandırılan, modelin gerçek ortamda zincirleme iş yürütme kabiliyeti, geçmiş Gemini nesillerinde zayıf halkaydı; bu kez tablo değişiyor. AutomationBench-AA ölçümünde yüzde 78 ile lider olan Argon, Terminal Bench 4'te yüzde 57 üretiyor ve siber güvenlik tarafında helpnetsecurity.com haberine göre Wiz'in Scan for Good girişimiyle halihazırda gerçek hastanelerde kritik açıklar tespit ediyor. CWE-bench v1'de yüzde 68'lik paylaşılan birincilik, modelin gerçek kod zafiyetlerini bulma ve yamalama kapasitesini doğruluyor.
Google'ın kendi iç operasyonundaki kullanım örnekleri, modelin neden bu kadar kısa sürede olgunlaştığını açıklıyor. DeepMind araştırmacıları kuantum algoritma alt rutinlerinde yayınlanmış tabanın yüzde 40 üzerine çıkarken, altyapı ekipleri veri merkezlerinde 300 TiB'in üzerinde belleği geri kazandırmış ve toplam potansiyeli 1 PiB civarında görüyor; libgav1'in C/C++'tan Rust'a taşınmasında ise 32 bin satırlık SIMD kodu güvenli Rust'a dönüştürülüp 2.7 kat hızlandırılmış. Bu kendi kendini iyileştiren üretim hattı, modelin hızlı evriminin arkasındaki asıl motor olabilir.
Erken Testler: Vokselden SVG'ye
Sunucunun sağladığı erken test ekran görüntüleri, modelin görsel yaratım tarafında da seviye atladığını gösteriyor. 106 binden fazla vokselle kurulan bir kiraz çiçeği koruluğu sahnesi, dinamik gün saati değişimiyle birlikte etkileyici duruyor; SVG olarak üretilen bir PS5 kumandası neredeyse fotoğraf gibi görünüyor ve mekanik arı, Kolezyum, 3B uçak simülasyonu gibi demolar önceki Gemini neslinin belirgin ötesinde bir detay disiplini sergiliyor. Yine de konuşmacı uyarıyor: bunların hangisinin nihai Argon mimarisiyle üretildiği belirsiz ve beklentiyi frenlemek gerekiyor.
Sonuç olarak konuşmacının oturduğu sandalye şöyle tanımlanabilir: Argon her şeyde usta değil, fakat maliyet, kapasite, güvenilirlik triumvirasında yılın en dengeli model adayı. Kodla ilgili en ileri uçlarda GPT-6 ailesi ya da Sonnet hâlâ; ama günlük bilgi işi, uzun doküman yönetimi, çoklu modlu analiz ve siber güvenlik gibi işlerin toplamında Argon, konuşmacının tabiriyle *ilk çekmecede duracak* araç olmaya çok yakın görünüyor.
Peki Rakipler Ne Yapacak?
AI yorumu
"Bana kalırsa yılın en ilginç atılımı bu değil, ama en mantıklısı bu: Google, pahalı vitrin modelleriyle yarışmak yerine maliyet-etkinlik ekseninde güçlü bir kale kuruyor. Fiyat, kapasite ve düşük halüsinasyon üçgeni gerçek anlamda dengeli görünüyor."
AI değerlendirmesi
En güçlü karşı görüş şu olurdu: bütün bu ölçümler Google'ın kendi açıkladığı ve henüz bağımsız üçüncü taraflarca yoğun biçimde doğrulanmamış erken rakamlar; early access modeli, genel kullanımın gerçek karmaşıklığında ne üreteceği bilinmiyor. Üstelik tanıtım fiyatı geçici: normal fiyat geldiğinde maliyet avantajı 1.99 yerine 3.98 dolar seviyesine çıkacak ve o zaman rekabet hesabı yeniden yazılacak.
Sınırlandırmalar da unutulmamalı: Argon şu an metin çıktısı veriyor, görsel/video girdi kabul ediyor ama görsel üretim değil; uygunluk hâlâ seçilmiş bir zümreyle sınırlı ve Google'ın Frontier Safety Framework taahhütleri ne kadar sıkı uygulanacak, izlemek gerekiyor. Konuşmacının çıkar bağlantısı da var: kanal sponsorluk ve abonelik geliriyle yaşadığı için coşku derecesi hep bir miktar şişirilmiş olabilir.
Pratik çıkarım: bu model resmi olarak yaygınlaşmadan toptan taşınma kararı vermeyin, ama pilot iş yüklerinizi şimdiden planlayın. Uzun bağlamlı doküman analizi, kurumsal bilgi işi ve stratejik siber operasyon taraflarında maliyet-etkin bir denemenin adresi Argon gibi duruyor; rakamlar olgunlaştıkça sektör liderlerinin yeniden fiyat kırıp kırmayacağını da izlemeye değer.
Kaynaklar
7 bağlantı; bunları kullanan başka yayımlanmış haber yok. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.
- @youtube.com YouTube — AI video report
- @blog.google Google Blog — Gemini 4 Argon announcement
- @deepmind.google Google DeepMind — Fairwind Program
- @artificialanalysis.ai Artificial Analysis — Gemini 4 Argon review
- @vals.ai Vals — Index benchmark
- @arxiv.org arXiv — LVBench methodology
- @helpnetsecurity.com Help Net Security — Argon coverage
gemini 4 argon · google deepmind · yapay zeka · fairwind · llm benchmarkları