Gündeme dön

Grok 4.7 Üç Ağır İnşa Testinde: Fable 5.1 ve Astra Karşısında Beşte Bir Fiyat Yeter mi?

Pat Simmons'ın **4474 kelimelik** tek atış incelemesi, xAI'ın **Grok 4.7** için Fable 5.1 ve Astra ile denk ve çok daha ucuz iddiasını üç ağır inşa ile sınar: **Awwwards piksel-klon, kaydırmalı 3D klavye sayfası ve Rainbow Road Mario Kart**. CursorBench'te **%46'ya karşı %51,6**, DeepSuite'te **%71'e karşı %70 / %72,7**, girdi **$2 / çıktı $6** karşısında **$10 / $50** fiyatla ve inşa başına **$7'ye karşı $123 / $97** faturayla tablo, ucuzluğun ağır kodda neden yetmediğini gösteriyor.

Nodesdaily’e aktarım: (UTC+03:00)
YouTube'da izle — x48xbDO6fKo
Okuma seçenekleri

Bu tarayıcıda cihazdan sesli okuma kullanılamıyor.

Kavram merceği

Bu görünümde geçen teknik kavramlardan birini seç. Genel tanımı, öğretici örneği ve haberdeki kullanımını birlikte oku.

Bu görünümde sözlüğümüzdeki kavramlardan biri bulunmadı. Sözlük henüz tüm terimleri kapsamıyor.

xAI'ın lansman notu Grok 4.7'nin Fable ve Astra düzeyinde ama belirgin ucuz olduğu teziyle açılıyor ve Pat Simmons bunu üç inşa ile tek karede sınamaya karar veriyor. Format net: aynı üç komut, üç modelde aynı anda tetikleniyor — Awwwards ödüllü siteyi piksel-piksel klonla, mekanik klavye için kaydırmalı 3D ürün sayfası kur, Rainbow Road'da Mario Kart'ı klonla — ve ölçüm üçlü: ne kadar sürede bitti, kaça mal oldu, kaç token yaktı . Videonun vaadi de bu denklemi göstermek: beş kat fiyat farkı gerçek inşa kalitesini kapatıyor mu , yoksa yalnızca tabloyu mu ucuzlatıyor? Tek atış kuralı baştan konuyor; hiçbir modele revizyon hakkı tanınmıyor.

Basın Notundan Piste: CursorBench ve Token Faturası Neyı Anlatıyor

İlk perde basın bülteninin kısa özeti. CursorBench 4.0 grafiğinde Y ekseni başarı, X ekseni görev başına maliyet; ideal köşe sağ üst. Fable 5.1 ekstra yüksekte %51,6, Grok 4.7 en yüksek çabayla ~%46 ; fark dört puan içi ama fiyat kanadı ters: Grok 4.7 ekstra yüksekte girdi $2 / çıktı $6, Fable ve Astra $10 / $50 . Simmons'ın vurgusu burada: skor birbirine yakın görünse de görev başına fatura Grok lehine belirgin açılıyor ve en ucuz modeli tarif eden etiket tam da bu yüzden Grok'un üzerine yapışıyor. Grafiğin küçük dipnotu da yerinde: Cursor'ı xAI satın aldı , bu yüzden tabloda taraf algısı notu düşülüyor; ayrıca GBT6 Astra CursorBench tablosundan çıkarılmış , karşılaştırma eksik sunuluyor.

İkinci katman diğer manşet skorlar. DeepSuite'te Grok 4.7 %71, Fable 5.1 %70, GPT-5.6 Soul %72,7 — yazılım mühendisliği hissiyatında Grok bir adım önde görünüyor, en azından bültenin seçtiği kesitte. Ardından çok saatlik ofis işi (AA Briefcase benzeri) skorları Fable, Soul ve Grok arasında başa baş akıyor; Harvey hukuk ajan benchmark'ında Grok güçlü, klinik akıl yürütmede de önceki Grok 4.6'yı aşarak Soul ve 5.1 çizgisine yaklaşıyor. Simmons, bültenin kod dışındaki bu bilgi işçiliği diliminde Grok'u bilerek parlattığını ve Terminal-Bench gibi kod-ağır tabloların alt metninde hikayenin tersine döndüğünü slaytla netleştiriyor; toplu slaytta Grok ofis ve hukukta Fable / Astra'yı tek tek geçtiği satırlar çoğalıyor, Astra yalnızca AutomationBench'te birkaç puan önde kalıyor.

Yöntem: Üç Komut, Tek Atış ve Clone-App Pro Tezgahı

Simmons'ın yöntemi abartıdan uzak: tek bir bash komutu üç modeli aynı anda üç inşa için koşturuyor. Her inşa için komut metni videoda paylaşılıyor ve blog notunda linklenecek. Ortak koşu bandı tek atış (one-shot) — hiçbir model ikinci deneme almıyor; bu, günlük kullanımda iterasyonla hatanın kapanabileceği gerçeğini dışarıda bırakıyor ama sınırın ham fotisini veriyor. Araç zinciri de standart: Awwwards klonunda clone-app-pro skill'i devreye giriyor — kodu gez, ekran görüntüsü al, QA süreçlerini işlet — böylece zevk, gezinme, görsel algı ve yönergeye uyum aynı anda test ediliyor. Sonunda kör reveal : A, B, C sütunları tek tek açılıp hangi çıktının kime ait olduğu söyleniyor, maliyet ve süreler yanına yazılıyor.

İlk inşa için komut kısa ama iddialı: Awwwards'a git, gerçekten etkileyici bulduğun ödüllü bir siteyi seç ve piksel-piksel yeniden kur; clone-app-pro skill'ini yükle, kendi işini ekran görüntüsüyle denetle. Simmons bu akışta modelin zevkini ölçtüğünü açıkça söylüyor — neyi etkileyici bulduğu, seçimin sıradan mı yoksa farklı mı olduğu — ve ardından siteyi gezme, görseli algılama, skill'i doğru yükleyip QA yapma, web bileşenlerini kurma katmanlarının geldiğini ekliyor. Gereksinimler minimal; marifet, modelin boşluktan varlık üretme yerine var olan ödüllü dili ne kadar sadık geri kurabildiğinde gizli. Her model aynı brief'i alıyor; fark, kaynak üretme ve animasyonu taşıma becerisinde çıkıyor.

Awwwards Klonu: ASI'dan Minimal Grid'e Üç Ayrı Zevk

Kör revealin A sütunu ASI temalı kurumsal işe alım sitesi : ‘ mühendisler, nicel araştırmacılar ve ML bilim insanları ’ başlığı, 2006'dan beri piyasaları hareket ettiren firmalar için araç üretme mottosu, yer yer rastgele logolar, çalışmayan arama kutusu, SVG üretimli bloklar ve kademeli scroll reveal’ları ile dağınık ama renk paleti dengeli bir akış. B sütunu Boach Studio / Club Road Coco etiketiyle ajan-portföy dilini seçiyor: sanat yönetimi, marka kimliği, kampanya filtreleri, Post Code Football Club gibi kartlar, bol SVG placeholder , yer yer consent yerine tek satır year/language hatırlatan sade alt bilgi — Simmons'ın notu ‘keşke görsel üretim becerisi verilseydi’ oluyor. C sütunu ise ödüllü ajans ezberini kırıyor: Wim Crouwel'ın grid tabanlı tipografi deneyi Minimal — ‘ kare ile başla, alfabeyi minimal grid’e programla ’ anlatısı, kaydırdıkça hareket eden grid’ler , uzayan tek sayfalık ders hissi. Simmons'ın favorisi bu üçüncü; uzun ve öğretici akışı bonus puan alıyor.

Referanslarla eşleştirme tabloyu netleştiriyor. ASI sayfası için Grok'un seçtiği Awwwards Box Studio ‘Visit site’ videosu, Grok çıktısıyla uzaktan benzer; varlık yoksa üretmesi beklenirken animasyonu taşımakla sınırlı kalıyor. Aspen Search için Fable çıktısı gerçek siteye çok yakın — animasyonların bir kısmı eksik ama ‘hangisi gerçek hangisi klon’ karışacak kadar benzer; blok girişleri ve partner şeridi neredeyse bire bir. Minimal grid için Astra'nın seçimi ise net kazanan : ekran görüntülerinden hareketi ve ızgarayı taşıması, diğer iki modelin SVG ile doldurmasına kıyasla belirgin üstün. Fatura, zevkin bedelini sayılaştırıyor: Fable 5.1 $123 (yaklaşık 90 milyon girdi / 1 milyon çıktı, ~4.000 saniye), Astra $97, Grok 4.7 $7 (~300 saniye) — ucuz ama zevk ve piksel sadakatinde geride etiketi ilk inşa sonunda Grok'a yapışıyor.

Klavye Sahnesi: Kaydırmayla Kurulan ve Patlayan 3D

İkinci inşa, önceki videodaki premium saat sayfasının klavye varyantı : tek kaydırmalı lüks mekanik klavye ürün sayfası, merkezinde gerçek zamanlı 3D model — sayfa kaydıkça model kuruluyor, patlayıp (explode) parçalarına ayrılıyor ve ziyaretçi kaydırmasıyla etiketleniyor (annotated) — üstüne yazmaya tepki şartı. Ürün brief'i kısa: premium mekanik klavye, gerçek zamanlı 3D, her şey kaydırma ile sürülüyor, yazma etkileşimi olacak, tam sayfa test edilecek . Simmons her model çıktısını yazma testi ve scroll testiyle birlikte geziyor; plan sesi, temas tonu ve doku da notlara giriyor. Beklenti yalnız 3D değil, 3D'nin web'e gömülme kalitesi — kaydırma animasyonunun siteye ait hissettirmesi .

Sahada ilk sütun mavi plan (blueprint) ve patlama evresi ile açılıyor; etiketler yer yer üst üste binse de scroll hızlandıkça parçalar toparlanıyor, yay, altın kontak yaprağı gibi detaylar yerli yerinde beliriyor, yer yer hızlı geçiş glitch'i ve tuşun klavye içinden fırlaması görülüyor. Çelik yay ve altın kontakta doku başarılı, ‘4 mm aşağı’ hazır notu ve “Less clutter, more character” ürün dili eşlik ediyor, klavye sesinin üretilmesi ve sepete ekle ile sayfa kapanıyor. İkinci sütun daha iyi 3D, pürüzsüz scroll ve doğru yerleşen etiketlerle bir adım öne çıkıyor: ‘Klavye ile yaz — bir şey yaz’ etkileşimi, Physical Vapor Deposition (lacquer değil, soyulmuyor, yontulmuyor) gibi spesifikasyon katmanı ve anahtar detayının (key) daha kontrollü sunumu göze çarpıyor; kapanışta hiçbir parça yerinden oynamadan model yeniden birleşiyor. Üçüncü sütun elden çizilmiş gazete dokulu farklı bir yorum deniyor; 3D sonradan geliyor, daha sade ve az detaylı , etiketler doğru ama model seyrek , anahtar agresif biçimde fırlıyor ve sepet bileşeni eksik kalıyor.

Bedeli ve yükü yan yana koyunca tablo keskinleşiyor. Fable 5.1: $58 (24 milyon girdi, 692 bin çıktı, ~869 saniye) — skor ve akıcılıkta referans. Grok 4.7: ~$5 ama çok daha uzun çalışma ve daha fazla token , çıktısı ise basit 3D ve daha az pürüzsüz akış. Astra: ~$5 ve Fable'a yakın kalite, çok daha verimli — Simmons'ın notu bu yüzden ‘Astra, Fable kadar iyi değil ama inanılmaz verimli’ oluyor. Burada da kazanan Fable/Astra çizgisi , kaybeden Grok olarak kayda geçiyor; fark, modelin ağır 3D'yi tek atışta kaldırmaması ve scroll fiziğini yeterince kotaramaması . Ucuz etiket yine Grok'ta, kalite etiketi ise Fable ve Astra arasında paylaşılıyor.

Prism Kart ve Rainbow Road: Fizik Sınavı

Üçüncü inşa Mario Kart klonu ; bu kez harita Rainbow Road ile güncellenmiş ve brief fizik üzerine kurulu. Sütun A Prism Cart : herhangi bir silgiyi seç → yarışa başla akışında basit illüstrasyonlu jenerik üretim , ama Rainbow Road benzeri harita ve fantastik fizik — kolay kontrol, boost hissi, yer yer harita kenarında tuhaflık olsa da tekrarlanabilir ve oynanabilir . Sütun B ve C'nin kaderi ise baştan karışık: B sütununda sağa basınca sola gitme — Simmons'ın bir önceki Astra/Fable testinde de gördüğü tersine çevrilmiş yatay eksen — QA'sız bırakılmış izlenimi veriyor; ‘sola gitmek için sağa basmam gerekiyor’ cümlesi videoda üç kez tekrarlanıyor. C sütunu ise tamamen dağınık : önce rakip araçları göstermesi gerekirken rastgele spawn , unplayable etiketini hak eden savruk fizik ve yine ters eksen ile birleşince en kötü hanesine yazılıyor.

Fatura burada ilk kez Grok'un aleyhine dönüyor. Fable 5.1: $52, ~3.000 saniye , Astra: $11, ~2.000 saniye , Grok 4.7: $16 — daha uzun süre, daha fazla girdi/çıktı token'ı , buna karşın en kötü oynanış . Simmons'ın reveal'i tabloyu mühürlüyor: en iyi fizik Fable , ters eksen hatası Astra'da tekrar , Grok 4.7 en zayıf halka . Üç inşa ortalamasında iki kez açık ara, bir kez farkla kaybetme Grok'un hanesine yazılıyor; maliyet avantajı burada revizyon ihtiyacını kapatmıyor çünkü üçüncü inşa için ‘kaç tur atarsan at Astra/Fable çizgisine gelmek zor’ notu düşülüyor — ucuzun bedeli, oynanabilirlik kaybı oluyor.

Üç inşa üst üste konunca desen net: Grok 4.7 ağır kod ve ajan-üretim işlerinde tek atışta geride , Fable 5.1 ve Astra önde . Videonun ikinci yarısındaki özet, bültenle sahayı aynı denkleme bağlıyor: girdi $2 / çıktı $6'ya karşı $10 / $50 — girdide beş kat, çıktıda sekiz kat fark — ve bu fark ofis ve bilgi işçiliği senaryosunda gerçekten kaldıraç; Grokbot, chatbt work veya co-work yerine Grok 4.7 rotası, gündelik görevleri daha ucuza kapatıyor ve bülten performans tablosunda Grok'un Fable ve Astra'yı geçtiği satırlar var. Buna karşın Terminal-Bench ve ağır kod tarafında Fable 5 (%26'dan %42'ye) ve Astra (%59 civarı) Grok'un %26 bandını belirgin açıyor; seçici sunumla DeepSuite'te %71 görünse bile genelde sınırın bir kademe altı kalıyor. Simmons'ın notu bu yüzden ‘sadece ağır kod testi sınırlı’ — bilgi işçiliği, otomasyon ve gündelik ajan zincirleri videoda test edilmedi.

Kapanış iki şerhi aynı sayfada tutuyor. Birincisi sınırlı test : üç inşa, ağır kod, bilgi işçiliği/otomasyon kapsam dışı ; bu yüzden Grok'un benchmark'larda öne çıktığı ofis otomasyonu bu sahnede görünmüyor. İkincisi tek atışın doğası : hiçbir model ikinci hak almadı; normalde iterasyonla toparlanacak bir 3D sayfası veya klon, videoda ilk çıktısıyla yargılandı. Ekonomi hesabı da burada düğümleniyor: beşte bir fiyatla Grok'u dört-beş kez koşturmak teoride bir Fable'a eşit , fakat Mario Kart gibi islerde artan fatura ve hâlâ uzak oynanış , revizyonun da çizgiyi kapatmaya yetmeyebileceğini gösteriyor. Simmons kişisel notunu da ekliyor: Chachi ve Fable'da iki ayrı max 20x aboneliği var ve limitlere sürekli vuruyor ; beşte bir fiyata ciddi bir rakip her son kullanıcı için iyi haber — keşke biraz daha iyi olsaydı diyor. Son tavsiye, donanıma yaslı bir gelecek okuması: xAI compute'a sahip, bu yüzden Grok gelişecek ve Fable/OpenAI çizgisine yaklaşacak ; o güne kadar model rotasyonu ve deneme şart. Yorum çağrısı da bu yüzden geliyor: bir sonraki sınır testinde ne inşa edilsin , yorumlara bırakın.

Görsel: nodesdaily AI

CursorBench Başarısı (yüksek iyi)

  • Fable 5.1%51,6
  • Grok 4.7%46
  • Fable 5 (eski)%26
  • Astra (eksik)—
Grok 4 puan geride ama fiyat 5 kat düşük; Astra CursorBench'ten çıkarılmış.
BaşlıkDurum
Fiyat kaldıracı$2/$6 vs $10/$50; 5 kat girdi, 8 kat çıktı
Awwwards ilk izGrok $7 ucuz ama zevk/sadakat geride
Ağır inşa eşiği3D ve Mario Kart'ta tek atış Grok geride
İnşaFable 5.1AstraGrok 4.7
Awwwards klon$123 / 4000s$97$7 / 300s
3D klavye$58 / 869s~$5~$5 uzun
Mario Kart$52 / 3000s$11 / 2000s$16 uzun

Videodaki anahtar anlar

  1. Tez: Fable/Astra denk ve beş kat ucuz
  2. CursorBench %46 vs %51,6 ve $2/$6 fiyat
  3. DeepSuite %71 ve ofis/hukuk satırları
  4. Yöntem: tek bash ile üç inşa tek atış
  5. Awwwards klon promptu ve skill
  6. Kör reveal A — ASI işe alım sitesi
  7. Kör reveal B — Boach Studio / Coco
  8. Kör reveal C — Minimal Crouwel grid

AI yorumu

"Bu videoyu satır satır deşerken sayaçlara takılı kalmamak için tek bir filtre kullandım: **fatura bölü skor**. xAI'ın CursorBench grafiğini ve üç inşa faturasını aynı denkleme koymazsam, $5'a karşı $58'lik etiketin hikayeyi tek başına anlatmasına izin vermiş olurum; o yüzden her paragrafı **tek atışın bedeli** üzerinden yazıyorum ve ‘beş kat ucuz’ cümlesini her seferinde hız, token ve oynanış kalitesiyle sınayıp okuyucuyu ofis otomasyonundaki güçlü tarafa yönlendiriyorum."

AI değerlendirmesi

Savunma tarafını da hak vererek açayım: xAI'ın girdi $2 / çıktı $6 bandını koruyarak CursorBench'te dört puan içi kalması ve ofis-hukuk-otomasyonda Fable/Astra'yı satır satır geçmesi , özellikle Grokbot ve çok saatlik bilgi işçiliği senaryosunda görev başına faturayı gerçekten aşağı çekiyor; satın alma masası skor yerine fatura/score okuyorsa, beş kat ödemek her bütçede rasyonel değil ve günlük işlerde hız + fiyat kaldıracı Grok'u mantıklı kılıyor.

Sınır, inşa tezgahında beliriyor. Tek atış kuralı Grok'un ağır 3D'yi ve piksel sadakatini ilk denemede taşımasını bekliyor ve Awwwards'ta zevk seçimi, klavyede 3D'nin olgunluğu ve Mario Kart'ta oynanabilir fizik Grok'ta düşüyor; klavye için $5'a karşı $58 ucuz ama etiketlerin üst üste binmesi, glitch ve sepet eksikliği , Mario Kart'ta ters eksen + savruk fizik ve ilk inşada $7'ye karşı $123'ün getirdiği SVG dolgu pratikte fiyatı silebiliyor. Cursor'ı xAI'ın sahiplenmesi ve Astra'nın CursorBench'ten çıkarılması da sunumdaki seçiciliği güçlendiriyor.

Doğrulanabilirlikte tablo test edilebilir: $2/$6 fiyat ve $10/$50 karşı fiyatı model kartında tutarlı; %46 / %51,6 / %71 / %72,7 / %70 skorları videoda grafik üzerinden okunuyor ve Grok 4.7'nin en ucuz model etiketi ile Fable $123 / Astra $97 / Grok $7 ve klavye/Mario Kart faturaları videoda ekran üstü sayaçlarla doğrulanıyor. Buna karşın ‘en iyi’ iddiası benchmark seçimine ve one-shot kurguya duyarlı ; Terminal-Bench %26 bandı ve ofis dışı kod-ağır işler Grok'u geride bırakıyor, DeepSuite'teki %71 tek başına genellenemez.

Pratik çıkarım seçici: Otomasyon hacmi yüksek, bağlamı orta ve gündelik işleri Grokbot/ajan zinciriyle kapatan ekipler için Grok 4.7 güçlü bir kaldıraç ve fiyat/performans şampiyonu olmaya aday; piksel-piksel Awwwards klonu, ağır 3D sayfası veya fizik isteyen oyun gibi cephe işlerinde ise Fable 5.1 / Astra hâlâ bir kademe önde . Karar, skoru değil Görev başına dolar ve revizyon ihtiyacını okuyarak verilmeli; model rotasyonu ve deneme bu yüzden kapanış tavsiyesi: bir sonraki test için inşa fikrini yorumlara bırakmak en rasyonel adım.

Kaynaklar

6 bağlantı; 1 tanesi 4 başka haberde de kullanılıyor. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.

grok 4.7 · xai · fable 5.1 · astra · cursorbench · deepsuite · awwwards klon

Konuyu takip et

Bu haberden önce

Aynı olayla editör tarafından ilişkilendirilmiş önceki haberlerden kısa bir okuma sırası.

Kanıt ve kaynaklar

İzinli kaynak metnini, sürümünü ve köken bilgisini incele.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…