Gündeme dön

Grok 4.7: Elon'un Büyük Vaadi Tabela ve Cüzdanda Sınanıyor

Elon'un bir aydır işaret ettiği Grok 4.7, xAI'in kod ve bilgi işleri için en yetenekli modeli iddiasıyla çıktı; Theo - t3.gg, fiyat ve hız aynı kalsa da jetonun iki katına çıkması, görev başı 3,74 dolar ve abonelik kotası üzerinden verimlilik anlatısını deliyor.

Nodesdaily’e aktarım: (UTC+03:00)
YouTube'da izle — jLgpzgpsWPc
Okuma seçenekleri

Bu tarayıcıda cihazdan sesli okuma kullanılamıyor.

Kavram merceği

Bu görünümde geçen teknik kavramlardan birini seç. Genel tanımı, öğretici örneği ve haberdeki kullanımını birlikte oku.

Bu görünümde sözlüğümüzdeki kavramlardan biri bulunmadı. Sözlük henüz tüm terimleri kapsamıyor.

Elon'un bir ay süren hype'ı ve SpaceX verisi iddiası

Elon bir aydan uzun süredir Grok 4.7'yi işaret ediyordu. Grok 4.5 çıktığında bile bir sonraki sürümün tüm mevcut modelleri geride bırakacağını söylemiş, SpaceX'in eğitim verisinin öyle eşsiz olduğunu iddia etmişti ki gerçek dünya kodlamasında Grok 4.7'den daha iyi bir model olursa şaşıracağını eklemişti. Video bu vaadi baştan hatırlatıyor, çünkü 4.7'nin birçok tabloda bir önceki sürüm olan 4.6'nın gerisine düşmesi tam da bu yüzden komik ve düşündürücü bulunuyor. Benim açımdan bu açılış, beklentiyi yönetme değil beklentiyi şişirme hikâyesi; vaat ile tablo arasındaki makas her geçen sürümde açılıyor.

Bu video rakam avı değil, rakamların anlamını sorguluyor

Theo'nun asıl tezi benchmarkların gerçeği temsil etmediği. Sayı çok, anlam az. Grok 4.7'yi sevdiğini, bu yıl kullandığı favoriler arasına koyduğunu da gizlemiyor, ama etrafta uçuşan yararsız istatistiklerden yorulduğunu söylüyor. Bence bu ayrım kritik: bir model iyi olabilir ve aynı anda onu anlatan metrikler kötü olabilir. İkisini birbirinden ayırmak, hem geliştirici hem de alıcı için sağlıklı karar demek. Bu yüzden video, resmi duyuru ve bağımsız ölçümler arasında gidip gelerek iki katmanı ayrı ayrı tartıyor.

xAI'in resmi duyurusu Grok 4.7'yi kod ve bilgi işleri için en yetenekli model diye tanımlıyor. Uzun süren zor görevlerde daha ısrarcı çalıştığı, kendi çıktısını daha dikkatli kontrol ettiği, bugüne kadarki en dengeli güvenlik kalibrasyonuyla geldiği vurgulanıyor. Aynı duyuruda fiyat ve hızın Grok 4.6 ile aynı olduğu ve bu sayede sınıfında rekabetçi kaldığı yazıyor. Bu ifade, Elon'un daha önce kurduğu çerçeveyle çarpışıyor. O çerçeve, 4.6'nın 1,5 trilyon parametreli ara sürüm, 4.7'nin ise 2,1 trilyon parametreli yeni bir taban olacağı, biraz daha yavaş ama jeton verimliliğinde daha iyi olacağı yönündeydi.

Yapay Analiz (Artificial Analysis) verisi bu çerçeveyi boşluğa düşürüyor. Yüksek muhakeme seviyesinde Grok 4.6 görev başına yaklaşık 38 bin jeton üretirken Grok 4.7 aynı tabloda 81 bin jetona çıkıyor, hatta Fable 5.1'in üstüne yerleşiyor. Soul ve Astra 29 bin civarında kalırken Grok 4.7'nin tüketimi iki katına katlanıyor. Video, tek başına istek başına artışı az göstermek ne kadar kolay olsa da görev başına maliyetin patladığını net şekilde ortaya koyuyor. Benim okumam şu: taban büyüdü demek ile jeton verimliliği arttı demek aynı cümlede durmuyor, burada biri feda edilmiş.

İstek başına maliyet ile görev başına maliyet aynı şey değil

Cursor'ın kurucusu ve şimdi xAI içindeki Michael Truell, 4.7'nin üretimde ortanca istekte yüzde 5, en kötü yüzde 1'lik dilimde yüzde 20-30 daha fazla jeton kullandığını söyleyip kullanıcıların daha ağır şeyler istemeye başlamasını da gerekçe gösteriyor. Theo bu yanıtı doğrudan tartışıyor, çünkü ölçüm sabit görevlerle yapılan bir benchmark. İstek başına metrik, ajanik iş yükünde tek bir kullanıcı promptunun birden fazla istek doğurduğu gerçeğini gizleyebilir. Yani istek başına artış küçük görünse bile prompt başına istek sayısı arttığında toplam maliyet şişer; Artificial Analysis giderek ajanik görevlere kaydıkça bu etki büyür. Burada ya ölçüm çerçevesi hatalı kurulmuş ya da açıklama bilerek dar tutulmuş.

Gerçek maliyet sayıları bu yüzden can yakıyor. Video, kendi çalıştırdığı masrafla Grok 4.7'nin en pahalı denemesinin API fiyatıyla 20 dolar tuttuğunu, Astra'nın en pahalı tekil koşusunun 11,44 dolarda kaldığını, Opus 5 koşularının ise bunun dörtte birinin altında seyrettiğini aktarıyor. Artificial Analysis'in görev başı maliyeti Grok 4.6'da 1,86 dolar iken Grok 4.7'de 3,74 dolar, Astra'da 3,26 dolar olarak görünüyor. xAI'in liste fiyatı kâğıt üstünde aynı kalsa da 200 bin jeton üstünde fiyatın iki katına çıkması ve hızlı varyantın bir kat daha pahalı olması, fiili faturayı yukarı itiyor. Benim deneyimim de bu yönde: liste fiyatı hikâyenin yarısı, faturalandırma mantığı diğer yarısı.

Cursor Bench, bu tartışmanın kalbindeki yer. Daha önce eğitim verisine sızmış bazı değerlendirmeler temizlenmiş, skorlar daha makul hale gelmiş durumda. Tabloda Astra'nın yokluğu dikkat çekiyor, gerekçe OpenAI'in xAI'in modellerini kıyaslamasına getirdiği yasak. Video, fiyat ve performans eğrilerinde Grok 4.7'nin çoğu seviyede Soul'a karşı iyi durduğunu, ancak düşük seviye Fable'ın bile Grok'un yüksek seviyesinden daha ucuz kalabildiğini gösteriyor. Yani verimlilik iddiası yalnızca en düşük muhakeme seviyesinde bir parça doğru. Üstelik Grokbot uyumu vurgusu ayrı bir artı: model, Cursor ve Grok Build içindeki ajan iskeletini doğal anlaması için eğitilmiş, bu da günlük kullanımda hissedilen akıcılığı açıklıyor.

Dış benchmarklarda tablo daha da sertleşiyor

Yazılım mühendisliği için DeepSWE v1.1, terminal için Terminal-Bench, hukuk için Harvey, sağlık için HealthBench ve kurumsal evrak için AA Briefcase gibi ek tablolar duyuruda seçmece duruyor. Video, bu setin en tuhaf lansman setlerinden biri olduğunu söyleyecek kadar ileri gidiyor. Terminal-Bench'te Grok 4.7 güzel görünürken Fable 5.1'in 20 puan, yani yaklaşık yüzde 50 önünde olması tabloyu değiştiriyor. GDPval gibi tablolarda 4.6'nın Astra'yı geçtiğini göstermek de tarihin bugünkü frontier ile ne kadar ilgisiz kaldığını ortaya koyuyor. Kısacası, duyurudaki iyi tablolar var ama eksik bağlamla sunuluyor.

Dışarıdan ölçümler daha acımasız. Artificial Analysis'in genel endeksinde Grok 4.7, GLM-5.3 Max'in biraz üstünde fakat Muse Spark 1.3'ün gerisinde kalıyor; yeni kod ajan endeksinde 56 puanla Codeex ve Claude Code'un 62'sinin gerisinde, Muse Code ve Spark 1.3'ü ise kıl payı geçiyor. Frontier Code tarafında ise gürültü yüksek, seviye artıkça eğrinin pürüzsüz olması beklenirken modeller seviye değiştikçe rastgele sıçrıyor, Grok 4.7 önceki sürümün gerisine düşebiliyor. xAI'in açıklamasında zor görevlerde güçlü ama bazı kolaylarda fazla düşünme eğilimi vurgulanıyor; bu da toplama vuruyor. Benim okumam, 6 puanlık farkın küçük görünse de ajanın saçmalama olasılığını ve dolayısıyla gereken gözetim süresini büyüttüğü yönünde.

Fiyatın aboneliğe yansıması da aynı hikâye. xAI'in kağıt fiyatı giriş için milyon başına 2 dolar, çıkış için 6 dolar, hızlı varyantta çıkış iki kat. Fakat 200 bini aşınca tarife katlanıyor ve hızlı mod normal kullanımı sert vuruyor. Podcast ortağı Ben Davis'in örneği çarpıcı: 40 dolarlık kullanım haftalık kotanın yüzde 8'ini yakmış, bu da 300 dolarlık planda haftalık bütçenin hızla eridiği anlamına geliyor. Rakip laboratuvarların 200 dolarlık planlarında ayda 8 ila 12 bin arası kullanım sunulurken Grok tarafında bol kullanım hissi kayboluyor. Model Soul/Opus liginde konumlanırken kota baskısı premium hissini sönümlüyor; ekonomik gerekçe zayıflıyor.

Ön yüz üretimi ise videonun en sert eleştirisini alıyor. Theo, aynı prompt ve aynı ortamda Grok 4.7'nin ürettiği arayüzleri son iki yılın en kötüleri arasında sayıyor, hatta GPT-5'in gerisinde buluyor. Oysa Anthropic hâlâ tasarımın kralı, Astra ise yönlendirmeye daha açık hale gelmiş. Bu gözlem, benchmarkların iyi ölçemediği bir boyuta işaret ediyor: estetik ve kullanılabilirlik, skor tablosunda görünmüyor ama ürün hissini belirliyor. Grok 4.7 burada belirgin şekilde tökezliyor; sunum kalitesi için ELO'nun 4.6'ya göre gerilemesi de bunu doğruluyor.

Lansmanın bir hafta gecikmesine dair paylaşılan not da jeton patlamasını açıklıyor. Ekip, pekiştirmeli öğrenmede yanıt uzunluğunu fazla cezalandırdığını ve modelin zor işlerde erken pes ettiğini fark edince son haftayı uzun yanıtlara istekli hale getirmeye ve doğrulamayı sıkılaştırmaya ayırmış. Bu müdahale, daha istekli ve detaycı bir davranış getirmiş ama verimlilikten çalmış. Sahada ise tuhaf döngüler görülüyor: Grok Build içinde model sonsuz bir motivasyon döngüsüne girip portal şablonunu yüz satırda kutsayıp duran, sonsuz inşa söylemine takılan bir senaryo ve çeviri katmanında sistem yönergesini sızdıran bir K-pop çeviri vakası. İkisi de pekiştirmenin yan etkisi gibi duruyor.

Theo'nun gerçekten sevdiği kısım ise ajanın söz dinlemesi. Grok 4.7, zirve anlarda Fable ve Astra kadar iyi değil ama tabanı daha yüksek: daha uzun süre raydan çıkmadan çalışıyor, derine iniyor ve gözden kaçanları bulabiliyor. Bunu test etmek için T3 Code tabanında iyileştirme önerileri ürettiren küçük bir deneme kuruyor; jüri olarak Fable 5.1 ve Astra kullanılıyor. Sonuçta Astra en yenilikçi ve en doğrulayıcı, Grok 4.7 hemen arkasında, Fable 5.1 daha az öneri ama yüksek kaliteyle geliyor. Maliyet tarafı ise yine can sıkıcı: en iyi durumda Astra/Fable ile benzer, en kötü durumda iki kat. Yani yetenek var ama fatura yeteneği gölgeliyor.

Son iki perde bu yüzden hem eğlenceli hem öğretici. Fish Slop denilen 3 boyutlu balık ve denizaltı oyununda aynı promptla Astra düzgün bir oyun çıkarırken Grok 4.7 balıkların ve denizaltının ters yöne gittiği, fare takibinin şaştığı, baş döndürücü bir sonuç üretiyor ve üstelik bir buçuk saatte. Bu, önceki sürümlerde sevilen hızlı ve ucuz Grok hissinin artık 4.6 ve 4.7'de kaybolduğunu gösteriyor. Theo'nun kapanış hükmü net: Grok 4.7 bir kilometre taşı değil, bir basamak. Daha fazla pekiştirme ile verimlilik toparlanabilirse değer önerisi döner, ama bugün frontier performansı frontier fiyatı olmadan sunuyor. Cursor'a kilitli değilseniz cazibesi sınırlı, kilitliyseniz denemeye değer.

Görsel: nodesdaily AI

AI yorumu

"Theo'nun ikili bakışına katılıyorum: Grok 4.7 kullanımı keyifli bir model, fakat etrafındaki sayı anlatısı yanıltıcı; modeli sevmek grafiğe inanmayı gerektirmiyor."

AI değerlendirmesi

Karşıt görüşü en güçlü haliyle kurayım: xAI'in savunması, gerçek kullanıcı trafiğinde ortanca isteğin yalnızca yüzde 5 daha pahalı olduğu ve ağır kuyrukta bile artışın sınırlı kaldığı yönünde. Grokbot gibi iskeletle birlikte düşünüldüğünde, ajan birden fazla istek üretse bile sistem bir bütün olarak daha pürüzsüz ve daha az müdahale gerektirir diyen bir bakış bu. Ben bu argümanın samimi olduğuna inanıyorum, çünkü üretim trafiği benchmark trafiği değildir ve ajanik kullanım görev başına maliyeti şişirirken kullanıcı deneyimini de iyileştirebilir. Sorun argümanın yanlış olması değil, ölçütün görev başına maliyet isteyen bir bench karşısında istek başına maliyetle yanıt vermesi.

Yine de eksikler net. Birincisi metodoloji sınırları: sabit promptlu benchmarklar maliyet artışını doğrudan ölçüyor, dağıtım kayması bu planda kurtarıcı değil. İkincisi seçmece sunum: duyurudaki tablo seti en güçlü olunan yerleri öne çıkarırken Terminal-Bench'te Fable'a 20 puan fark ve genel endekste Spark gerisi gibi zayıf karnı karartıyor. Üçüncüsü maliyet şeffaflığı: liste fiyatı sabit kalsa da 200 bin üstü ve hızlı varyant katsayıları normal kullanımda faturayı şişiriyor, abonelik kotası da 40 dolarda yüzde 8 erimeyle bunu hissettiriyor. Dördüncüsü yan etkiler: pekiştirmeyle uzayan doğrulama ve sızan çeviri yönergeleri, verimlilik kadar güvenlik ve öngörülebilirlik sorusu da doğuruyor.

Çıkar ve doğrulama açısından tablo dengeli okunmalı. Skorların bir kısmı bağımsız doğrulamadan geçti (CursorBench'in temizliği, Artificial Analysis'in ajanik ağırlık güncellemesi), fakat Astra kıyasının yokluğu yapısal bir boşluk bırakıyor ve Fable 5.1'in DeepSWE gibi yerlerde resmi sitede görünmemesi soru işareti yaratıyor. xAI'in güvenlik vurgusu LatchBio ve HackerBench gibi tablolarda iyi, ancak sızıntı örnekleri ürün entegrasyonunda aynı disiplini garanti etmiyor. Ben olsam her bench skorunu, aynı modelin kendi önceki sürümüne göre jeton ve süre artışıyla birlikte okur, tek başına liderlik iddiasını değil maliyetli liderlik bedelini de hesaba katardım.

Pratik çıkarımım şu: Grok 4.7, ajanla uzun süre baş başa çalışmayı seven ve derinlemesine tarama kıymetli bulanlar için denemeye değer, özellikle Cursor/Grok Build içinde yerleşik iseniz. Hız ve düşük fatura önceliğiniz ise, Fable 5.1 ve Astra hâlâ daha verimli bir önerme sunuyor; ön yüz kalitesi beklentiniz yüksekse Grok 4.7 şu an geride. Kota hassasiyetiniz varsa 300 dolarlık planın haftalık erimesini ve 200 bin üstü katsayıyı bütçelendirin, aksi halde en iyi durumda kafa kafaya, en kötü durumda iki kat fatura riskiyle karşılaşırsınız. Benim için bu sürüm bir eşik değil, bir ara durak; bir sonraki pekiştirme turu verimliliği toparlamadan fiyat/performans gerekçesi zayıf kalıyor.

Kaynaklar

6 bağlantı; 2 tanesi 6 başka haberde de kullanılıyor. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.

grok 4.7 · xai · benchmark

Konuyu takip et

Bu haberden önce

Aynı olayla editör tarafından ilişkilendirilmiş önceki haberlerden kısa bir okuma sırası.

Kanıt ve kaynaklar

İzinli kaynak metnini, sürümünü ve köken bilgisini incele.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…