Gündeme dön

Grok 4.7 Geldi: Elon Sözünü Tutabildi mi? Yarı Fiyata Sınırın Bir Adım Gerisi

xAI'ın 21 Eylül'de aynı fiyat ve hızla sessizce yayınladığı **Grok 4.7**, Matthew Berman'ın **2819 kelimelik** mercek altı incelemesinde Elon Musk'ın Opus 5 ile denk olma öngörüsüyle sınanıyor; CursorBench 4.0'da **%46,3 ile %33 arasındaki dev sıçrama**, DeepSWE'de **%71**, Terminal-Bench 4.0'da **%38** ve Hukuk benchmark'ında **%19,6** gibi tabloyu dolduran skorlar, modelin neden Anthropic'in Fable 5.1 ve Astra'sının gölgesinde **beşinci sıraya** yerleştiğini, buna karşın **girdi $2 / çıktı $6** fiyatıyla göreve tamamlama maliyetinde nasıl ezber bozduğunu gösteriyor.

Nodesdaily’e aktarım: (UTC+03:00)
YouTube'da izle — MJllZbpvrAc
Okuma seçenekleri

Bu tarayıcıda cihazdan sesli okuma kullanılamıyor.

Kavram merceği

Bu görünümde geçen teknik kavramlardan birini seç. Genel tanımı, öğretici örneği ve haberdeki kullanımını birlikte oku.

Bu görünümde sözlüğümüzdeki kavramlardan biri bulunmadı. Sözlük henüz tüm terimleri kapsamıyor.

Elon Musk'ın bir hafta önce paylaştığı ‘Grok 4.7 kabaca Opus 5 düzeyinde olacak, 5.1 değil’ öngörüsü, 21 Eylül sessiz lansmanıyla teste girdi. xAI blogu Grok 4.7'yi ‘bugüne dek kod ve bilgi işçiliği için en yetkin modelimiz’ diye tanımlıyor: daha uzun süre görevde kalıyor, kendi çıktısını daha titiz denetliyor ve bugüne kadarki en kalibreli koruma yığınıyla geliyor. Teknik temel değişti: daha büyük bir baz model , çok saat süren görevlere ağırlık veren daha uzun pekiştirmeli öğrenme ve Grok Bot harness'ini yerel anlama ; üstüne belge ve sunum üretiminde gözle görülür iyileşme. Fiyat ve hız bilinçli olarak sabit tutuldu: milyon girdi token'ı $2, önbellekli girdi $0,50, çıktı $6 — hızlı varyantta iki katı. Gecikmenin nedeni de itirafta saklı: Musk'ın aktardığına göre ekip yanıt uzunluğunu pekiştirmeli öğrenmede fazla cezalandırmış , model zor görevlerde erken pes edip işini yeterince sıkı doğrulamıyormuş; birkaç gün fazla pişirmek bilinçli tercih oldu.

Maliyet ve Zeka Yoğunluğu: CursorBench Neyi Ölçüyor

CursorBench 4.0, çok saatlik IDE ajanlarının uzun ufuklu kod görevlerindeki başarısını ölçer ve xAI'ın Cursor'ı satın almış olması çıkar notu olarak tablonun üstünde durur. Videoda Y ekseni başarı yüzdesi , X ekseni görev başına ortalama maliyet ; ideal nokta sağ üst: yüksek skor, düşük fatura. Grok 4.7 düşük çabayla %33'te, ekstra yüksek düşünme ile %46,3'te — aradaki makas videoda ‘GPT-5.6 Soul dışındaki en büyük eğrilerden biri’ diye vurgulanıyor. Sınırda Opus 5'in hemen arkasında kalıyor ancak maliyet yaklaşık yarı yarıya ; aynı işi daha ucuza kapatıyor. İkinci projeksiyon aynı benchmark'ı görev başına ortalama çıktı token'ı üzerinden okuyor: aşağıda kalmak daha iyi , yani zeka yoğunluğu yüksek. Model ister iki kat token yakıp yarı fiyatla gelsin ister az tokenla pahalı kalsın, görev başına tamamlanma maliyeti denkleşebilir. Bu lensle Grok 4.7, Opus 5 ile neredeyse örtüşüyor; Fable 5.1 skor olarak önde ama token başına maliyet katlandığı için görev başına fatura belirgin şişiyor. Mesaj net: skor tek başına değil, skor bölü fatura karar verdirir.

Aynı tablonun üçüncü kesiti görev başına adım sayısı ; burada GPT-5.6 Soul en verimli görünüyor ve Berman'ın kişisel deneyimi bunu doğruluyor: Soul, çözüme en kestirme yolu bulan model hissi veriyor. Fable 5.1 yine tepeye yakın. Grok ailesi adım ve token verimliliğinde sınırın hemen gerisinde ama tutarlı ; düşük çaba modu ucuz ve hızlı, yüksek düşünme modu ise pahalı ama isabetli. xAI'ın model kartı bu tercihi resmileştiriyor: standart 256 bin pencere, uzun bağlam 500 bin , 256 bini aşan girdilerde standart 2 kat, hızlı 3 kat fiyatlanıyor; uzun bağlam faturalandırması yalnızca girdi uzunluğuna bakıyor. Bu katman, mimari kararı bir ekonomi kararına bağlıyor: bağlamı büyütmek bedava değil, strateji bağlamın gerçekten gerekip gerekmediğini tartmalı.

Kod cephesinin ikinci gösterimi DeepSWE v1.1 — üretim ortamındaki mühendis hissiyatını en iyi yansıtan benchmark'lardan biri olarak anılıyor. Tablo: Grok 4.7 %71, GPT-5.6 Soul %72,7, Fable 5.1 %70 ; ilk bakışta Grok önde. Ancak Berman'ın işaret ettiği seçici sunum detayı kritik: xAI blogu bu tabloda Astra'yı göstermiyor . Berman, Astra'nın aynı tabloyu kendine ekleyerek yeniden kurduğu versiyonu paylaşıyor ve skor Astra Max %74,1 ile liderliği alıyor ; DeepSWE'de gerçek zirve değişiyor. AA Briefcase (çok saatlik ofis işi) tarafında Grok 4.7 ve Fable 5.1 Max başa baş, Terminal-Bench 4.0 ise ayrıştırıcı: Grok 4.7 %38 ile Fable 5.1 %57,9 ve Astra 58,2'nin belirgin gerisinde — terminal yetkinliği ajan kodlamada hız ve özerklik belirlediği için bu makas pratikte hissedilir. Hukuk işi sürprizi tersine: Grok 4.7 %19,6 ile tablonun açık ara öncüsü , aile mirası da güçlü ( 4.6 %15,8 ); Soul %2,5, Fable %6,7, Astra %5,4 ile dökülüyor, fakat gecenin yıldızı Muse Spark 1.2 %42 ile tümünü geride bırakıyor . HealthBench Professional dengede, Elektrik Mühendisliği Bench ise Grok'u Astra çıkarılsa birinci yapacak kadar yakın ama Astra varken ikincilikte bırakıyor. Ortaya çıkan desen: Grok bazı ofis ve hukuk işlerinde sınırda, terminal ve ağır kodda bir kademe geride .

Fiyat, Bağlam Penceresi ve Rekabetin Ekonomisi

xAI fiyatı bilinçli olarak sınırın bir kademe altı + bol arz denklemiyle kuruyor. Grok 4.7 $2/$6 , Opus 5 $5/$25 , Fable 5.1 $10/$50 ; kabaca Soul iki kat, Fable ve Astra beş kat pahalı. Model kartı ve Cursor dokümantasyonu uzun bağlamın fiyat çarpanını da şeffaflaştırıyor, fakat ekonomik mantık arz fazlasında : xAI baştan fazla yatırım yaptığı GPU kümesini frontier talebiyle dolduramayınca fiyatı düşürerek kullanım yaratmak zorunda kaldı. Berman'ın hatırlattığı Gavin Baker notu tabloyu tamamlıyor: kurumsal token'ların %62'si açık ağırlıklara, %38'i kapalı modellere akıyor; çünkü açık modeller daha ucuz, daha kontrol edilebilir, daha mahrem ve özelleştirilebilir. Buna rağmen değerin büyük kısmı hâlâ OpenAI ve Anthropic'e akıyor — açık pay alsa bile bulut altyapısı aynı flop, aynı bellek, aynı watt'ı tükettiği için marj altyapı katmanına kayıyor. Çıkarım acı ama net: sınır cevabı yoksa sınır fiyatı istenemez ; bazı sektörler en iyi cevaba beş kat ödemeye razı, bazıları otomasyon ve bilgi işçiliği için yeterince iyi ve ucuz olanı tercih ediyor. Token başına zekayı sıkıştırmak ile çıktıyı kısarak kapasite yaymak arasındaki fark, marj hikâyesini de belirliyor.

GDPval, Briefcase ve Yeni Koruma Kalkanı

Bilgi işçiliğinin gerçek dünya provası iki Elo tablosunda: GDPval-AA'da Fable 5.1 1735, Grok 4.7 1695, Astra 1542 ; AA Briefcase'te Fable 1678, Grok 1657, Opus 5 geride . xAI'ın neden Astra'yı GDPval'da gösterip DeepSWE'de göstermediği sorusu burada anlam kazanıyor — güçlü olduğu yerde şeffaf, zayıf olduğu yerde sessiz durma izlenimi güçleniyor. Blogun altını çizdiği diğer başlık tamamen yenilenmiş koruma yığını : ret ve jailbreak direncinde bugüne dek en güçlü test , Q* prompter ve çift kullanımlı alanlarda (siber güvenlik, biyoloji) hem masum görevde fayda hem tehlikeli istekte güvenli rette liderlik iddiası. Sayılar: LatchBio Biosafety %62,4 ile tepe, LatchBio Capabilities %44,5 (xhigh) , HackerBench v0.3'te riskli çift kullanımlı isteklerin yalnızca %3,3'ünü geçirme ve meşru güvenlik işini nadiren engelleme. xAI, bu kırmızı takım yetkinliğinin bir kısmını davetli siber güvenlik ortaklarına açtığını da duyurdu. Mekanizma tarafında: biyolojik veri analizinde RNA ifadesi analizi, epigenetik düzenleme, varyant ve terapötik keşif gibi 11 yetenek benchi ortalaması alınıyor; BioSecBench-Refusal/Surveillance/Function ise gizli biyolojik tehlikeyi bulma ve çiğ patojen dizilemesini izlemeyi ölçüyor. Sonuç: Grok 4.7 genel biyoloji bilgisini korurken çift kullanımlı yetkinlikte ölçülebilir bir sıçrama sergiliyor ama ölçümler korumasız ham yetkinlik üzerinden raporlanıyor — ürün yüzeyindeki filtreler ayrı katman.

Lansmanın küçük notu büyük beklentiyi de test ediyor. Elon'ın 12 Ağustos ‘Grok 4.7 mevcut tüm modelleri aşacak’ paylaşımı, o tarihte Fable zaten sahadayken Fable 5'e yakın ama 5.1'in gerisinde kalan gerçekleşmeyle karşılaştırılıyor; Berman'ın yorumu ‘Elon için çok tipik: agresif takvim, agresif öngörü’ ve uzun vadede ona karşı bahse girmemek gerektiği. Musk'ın gecikme açıklaması da aynı tonda: ‘Birkaç gün daha pişmesi gerek, yanıt uzunluğunu fazla cezalandırmış olabiliriz ya da başka bir şey’ — ‘ya da başka bir şey’ ifadesinin muğlaklığı videoda esprili bir paranteze dönüşüyor, yine de erken pes etme ve yetersiz öz denetim teşhisi net. Model bugün Cursor ve Grok Build üzerinden, ayrıca Grok API, üçüncü taraf harness'ler ve model yönlendiricileri üzerinden erişilebilir; kimlik grok-4.7 . Berman'ın son kişisel notu rekabetin kendisi üzerine: daha fazla oyuncu, son kullanıcı için iyi ; Grok 4.7 48 veya 49'da sınıra ulaşır mı bilinmez ama şimdilik yeterince yakın ve maliyet açısından ezber bozucu .

Dış doğrulama Artificial Analysis Intelligence Index v4.3.2 ile geliyor: Fable 5.1 birinci, Astra ikinci (aynı skor), Opus 5 üçüncü, Muse Spark 1.3 Max 48 ile dördüncü, Grok 4.7 (xhigh) 46 ile beşinci — GLM-4.7 ve Kimi K3 gibi açık ağırlıklar hemen geride. Endeks 10 değerlendirmeyi harmanlıyor: AA-Briefcase, GDPval-AA, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam ve diğerleri. Grok 4.7'nin Grok 4.6'ya göre +2 puanlık artışı mütevazı görünse de AA-Briefcase'te +111 Elo (1657) ve GDPval-AA'da +90 (1695) ile uzun ufuklu ajan işinde belirgin. Blogun da doğruladığı püf nokta: kazanımlar daha yüksek token kullanımıyla geliyor — Grok 4.7 görev başına ~81 bin çıktı token'ı , 4.6'da 38 bin , Muse Spark 1.3'te 60 bin, Astra'da 27 bin . Yani zeka endeksi tek başına maliyet hikâyesini anlatmıyor; görev başına maliyet ve hız ayrı okunmalı . Berman'ın grafikte ‘cost per intelligence’ katmanında Grok 4.7'yi seçili görmesine rağmen noktanın belirmemesi ve 4.6'nın toplam endeks maliyetinde ~$2.300 civarında konumlanması, 7'nin de benzer düşük maliyet bandında kalacağı beklentisini yaratıyor.

Bağlam penceresi detayı da karar tablosuna yazılmalı: Grok 4.6 ve 4.7'de standart 256 bin, uzun bağlam 500 bin ; neredeyse tüm diğer frontier modeller 1 milyon . Günlük kullanımda 250 bini aşmayan işlerde fark hissedilmeyebilir ama çok büyük repo, uzun hukuki dosya veya yüzlerce sayfalık rapor senaryosunda sınır belirleyici olur. Faturalandırma nüansı da pratikte önemli: 256 bin altı fiyatta, üstü 2 kat (standart) veya 3 kat (hızlı) — uzun bağlam ücreti yalnızca girdi uzunluğuna göre tetiklenir. Bu, maliyet hesabını bağlam stratijisine bağlıyor : mümkünse bağlamı sıkıştırmak, bölmek veya önbelleklemek faturayı doğrudan düşürür. Mimari kararı ekonomi kararına dönüştüren tam da bu katmandır.

Sahada ilk izlenimler karışık ama öğretici. Musk'ın ‘bir saat önce itibarıyla xAI, agentic coding'de Anthropic ve OpenAI'den sonra üçüncü’ paylaşımı rekabetin tonunu veriyor; Bobby'nin Grok 4.7 vs Kimi K3 demosu ise videoda ‘korkunç derecede kötü’ diye anılan bir Kare ile anılıyor — Berman, ayarlar ve harness farkı notunu düşerek genelleme uyarısı yapıyor. Zapier entegrasyonu gibi otomasyon köprüleri de pratik kullanımda belirleyici: 9 binden fazla uygulama, MCP sunucusu, Cursor/Nvidia/Samsung/Dropbox/Shopify referansları ve Gmail'den Asana'ya görev akışı örneği, modelin bilgi işçiliği otomasyonunda fiyat/performans kaldıracı olarak nerede parladığını gösteriyor, abartılı vaat yerine uygun iş yükü vurgusuyla. Sonuç tablosu sade: Grok 4.7 mutlak zirvede değil, zirvenin bir adım gerisinde; ancak yarı fiyat ve aynı hızla, otomasyona ihtiyaç duyan ekipler için ‘yeterince iyi’yi ‘fazlasıyla mantıklı’ya çeviriyor . Berman'ın kapanışı bu yüzden ‘48'de sınıra gelir mi bilinmez ama bugün rekabetin kendisi kazandırıyor’ diyor — bir sonraki adımın Grokbot'a 4.7 güncellemesi olmasını beklemek de bu iyimserliğin doğal uzantısı.

Görsel: nodesdaily AI

Görev Başına Maliyet Ekseninde Kod Zirvesi

  • Grok 4.7$3 avg
  • Opus 5$10 avg
  • Fable 5.1$15 avg
  • Muse 1.3 open~$1.5
Harmanlanmış ortalama $/MTok göstergesi; gerçek fatura token ve adıma bağlı.
BaşlıkDurum
Grok 4.7 fiyat$2 / $6 aynı hız, 500K uzun
Kod zirvesiDeepSWE %71, Terminal %38: geride
Ofis ve hukukGDPval 1695, hukuk %19,6: sınırda
ModelGirdi / ÇıktıCursorBench
Grok 4.7$2 / $6%46,3 xhigh
Opus 5$5 / $25~%47–48
Fable 5.1$10 / $50~%52+
Muse Spark 1.2açık ağırlık%42 hukuk

Videodaki anahtar anlar

  1. Elon tahmini: Opus 5 dengi
  2. CursorBench 46,3% vs %33 delta
  3. DeepSWE 71% ve Astra'nın dönüşü
  4. Terminal %38 vs 58% makası
  5. Hukuk %19,6 ve Muse Spark %42
  6. Fiyat ve açık ağırlık %62
  7. GDPval 1695 ve koruma kalkanı

AI yorumu

"Bu incelemeyi izlerken ilk refleksim grafiğin sağ üst köşesine aldanmamak oldu. Grok 4.7'nin CursorBench'te Opus 5'i neredeyse yakalaması ilk bakışta zafer gibi duruyor; ben bu yazıyı **maliyet, token yoğunluğu ve bağlam penceresi** üçgeninde kurmazsam okuyucunun sadece skora bakıp fiyatı kaçıracağını düşündüğüm için her tabloyu dolar ve token süzgecinden geçirerek anlatmaya karar verdim."

AI değerlendirmesi

En güçlü hâliyle savunmayı da hakkını vererek kuralım: xAI'ın fiyatı sabit tutup uzun ufuklu RL ile çıta yükseltmesi , özellikle ofis ve hukuk işi gibi uzun bağlamlı üretim işlerinde maliyet-performans eşiğini gerçekten kaydırıyor; görev başına maliyet odaklı bakan bir satın alma masası için Fable 5.1'in %5'lik skor üstünlüğüne beş kat ödemek rasyonel olmayabilir; koruma yığınındaki LatchBio 62,4% ve HackerBench 3,3% gibi sayılar da kurumsal risk filtresinde artı yazıyor.

Sınır, metodolojide ve sunumda beliriyor. xAI'ın Cursor'ı sahiplenmesi çıkar çatışması gölgesi yaratıyor; DeepSWE tablosunda Astra'nın çıkarılması seçici sunum algısını güçlendiriyor; Terminal-Bench'te %38 ile %58 bandı arasındaki makas ağır ajan kodlamada hissedilir ve token kullanımının 38 binden 81 bine çıkması görev başına faturayı şişiriyor; 500 bin bağlamın 1 milyona karşı dezavantajı büyük dosya senaryosunda pratiğe değiyor. Ölçümlerin bir kısmı Grok Build harness'ine özgü ve bağımsız doğrulama bekliyor.

Doğrulama karışık ama test edilebilir: x.ai/blog ve model kartı fiyat, bağlam ve RL tarifinde tutarlı; Artificial Analysis Elo ve token sayıları bağımsız ölçümle örtüşüyor ( Briefcase 1657, GDPval 1695, ~81k token ); llm-stats kartı aynı skorları aynı çabayla kıyaslamadan sunma notunu düşerek şişirme riskini azaltıyor. Buna karşın ‘en iyi’ iddiası benchmark seçimine ve harness’e duyarlı ; hukuktaki %42'lik Muse Spark outlier'ı tek bir modelin niş üstünlüğünün genellenemeyeceğini gösteriyor.

Pratik çıkarım seçici: Otomasyon hacmi yüksek, hata toleransı orta ve bağlamı 256–500 bin içinde kalan ekipler için Grok 4.7 ezber bozan bir kaldıraç ; hukuki üretim ve ofis dokümanı gibi işlerde fiyat/performans şampiyonu olabilir. Terminal-ağır, çok adımlı ajan kodlamada ve milyon token’lık derin bağlamda ise Fable/Astra/Opus hâlâ bir kademe önde ; en iyi cevap için beş kat ödemeye hazır olanlar o yolda kalacak. Karar, skor tablosunu değil, görev başına dolar ve token yoğunluğunu okuyarak verilmeli.

Kaynaklar

8 bağlantı; 3 tanesi 6 başka haberde de kullanılıyor. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.

grok 4.7 · xai · cursorbench · deepswe · terminal-bench · yapay zeka fiyat · bağlam penceresi

Konuyu takip et

Bu haberden önce

Aynı olayla editör tarafından ilişkilendirilmiş önceki haberlerden kısa bir okuma sırası.

Kanıt ve kaynaklar

İzinli kaynak metnini, sürümünü ve köken bilgisini incele.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…