17 satırlık tabloyu önüme açtım: en üstte GPT-6.1 Sol 90.1, hemen gerisinde GPT-6 Sol 89.9, üçüncü sırada Claude Sonnet 5.5 86.8 yazıyor. Ölçümün adı tasarım arenası; model vitrin çalışması üretiyor, jüri de işin bitmiş haline puan veriyor. Fatura tarafı da aynı tabloda: Sol kardeşlerde $0.382 ve $0.297, Sonnet tarafında $0.574. Bu ilk üç satırın tamamı open-design.ai kayıtlarından geliyor; sayfada her model için puan ve artifact başına tahmin yan yana duruyor.
Zirvedeki ikilinin hikayesi Eylül sonuna uzanıyor: GPT-6.1 Sol 29 Eylül DevDay sahnesinde GPT-6 Sol yerine geçti, liste $2 giriş ve $10 çıkış ile amiral Astra fiyatının beşte birinde kaldı. venturebeat.com derlemesi de aynı çizgide: Astra dengi ajan işleri ve bilgisayar kullanımı, Ultrafast kademede 300 jeton/s hıza kadar. Benim gözümde tablo burada dürüst: yapay zeka vitrininde 0.2 puan fark için %29 fazla ödeme yapılıyor. Benchmark tarafında Sol ailesi Intelligence Index 48 bandında ölçülüyor, hız da 100 jeton/s dolayında.
Sonnet 5.5 cephesi 28 Eylül sürümüyle geliyor: liste $2 giriş, $10 çıkış, cache okuma yarıya inmiş $0.10. artificialanalysis.ai ölçümü Sonnet 5.5 tarafını Intelligence Index 56 ile amiral Opus 5.5 tarafının 2 gerisinde gösteriyor, Terminal Bench 4.0 tarafında ise %70.6 ile Opus tarafını geçtiği yazıyor. Tasarım arenası puanı 86.8 olan bu model için artifact faturası $0.574 görünüyor. Benim okumam şu: tek çatı içinde kalan ekip için Sonnet tarafı güvenli liman, fatura da öngörülebilir. Ajan iş yükünde cache indirimi gideri %20 dolayında hafifletiyor.
Zirve pahalı, orta sıra akıllı
Orta sıra bu tablonun en zevkli yeri: MiMo 2.6 Flash 83.5 puanla $0.029, GPT-6 Luna 83.1 puanla $0.016, Grok 4.7 82.9 puanla $0.662 yazıyor. openrouter.ai karşılaştırma sayfası aradaki yapı farkını açık koyuyor: Grok 4.7 tarafı 500K bağlam ile $2 giriş ve $6 çıkış listelerken MiMo Flash tarafı 1.05M bağlam ile $0.10 giriş ve $0.28 çıkış listeliyor. Yani benzer benchmark bandı, 20 kattan büyük fiyat makası. Ben olsam vitrin denemesinde Grok tarafını değil, açık ağırlıklı MiMo tarafını ya da Luna tarafını denerim. Token gideri burada karar verici oluyor.
Görselde okla işaretlenen satır Claude Haiku 5.5: 82.2 puan, $0.018 fatura. anthropic.com duyurusu 7 Ekim tarihli: 100 bin jetona kadar $0.10 giriş ve $0.50 çıkış, üstünde iki kalem de beş katına çıkıyor, bağlam 1M. artificialanalysis.ai ölçümü Haiku 5.5 tarafını azami gayrette Intelligence Index 43 ile fiyat sınıfında ikinci sıraya koyuyor, görev başına $0.21 gider yazıyor. beam.ai incelemesi de aynı yönde: orta gayrette 34 puan ve $0.05 gider, alt ajan işleri için biçilmiş rol. Benim için bu satır tablonun yıldızı: Sonnet tarafının 4.6 eksiği, faturanın otuzda biri. LLM tercihlerinde bu oran az bulunur.
Astra satırı tabloyu bozan istisna: 82.7 puan, $1.61 fatura. Liste fiyatı $10 giriş ve $50 çıkış olan amiral model burada Luna tarafının 0.4 gerisinde, faturanın 100 katında duruyor. Fable 5.1 satırı daha da çarpıcı: 80.3 puan, $3.66 ile tablonun en pahalı hücresi. artificialanalysis.ai kayıtları Fable tarafını $10 giriş ve $50 çıkış ile Intelligence Index görevinde $2.37 ile $3.76 arasında giderle gösteriyor. Benim yorumum sert: genel yapay zeka gücü yüksek olabilir, ama bu arenada fiyat-performans çizgisinin çok dışında kalıyor. Model seçerken liste fiyatına değil, bitmiş iş faturasına bakıyorum.
Pahalı kanat ve alt sıra
Flash koridoru devam ediyor: DeepSeek V4.1 Flash 81.2 puanla $0.023, GLM-5.3 Flash-X 80.1 puanla $0.098 yazıyor. yottalabs.ai karşılaştırması perde arkasını veriyor: DeepSeek tarafı 552B büyüklükte $0.044 giriş ve $0.30 çıkış bandında, GLM tarafı $0.036 giriş ve $0.50 çıkış bandında listeleniyor. openrouter.ai anlık fiyatları da aynı yönde. Bu iki satır benim için Haiku-Luna ikilisinin yedeği: biri tıkanırsa diğeri devrede. Benchmark farkı 1.1 puan, fatura farkı 4 kat; burada da pahalı olan değil, akıllı kullanılan kazanıyor. Ajan döngüsünde cache okuma gideri belirleyici oluyor.
Bir alt basamakta GPT-5.6 Sol 77.6 puanla $0.544, Hunyuan H4 Preview 74.6 puanla $0.418, Qwen 3.8-Max 72.0 puanla $0.595 duruyor. open-design.ai sayfası en iyi değer rozetini Luna tarafına veriyor: zirve puanın %92 bandı, zirve giderin %4 bandı. Bu oran benim yazı boyunca kurduğum tezi taşıyor: 5 ile 13 puan gerideki model faturada 30 ile 40 kat geride. Qwen tarafı $2 giriş ve $6 çıkış listesiyle bu arenada pahalı kalıyor. Token başına ödeme ile bitmiş iş başına ödeme aynı şey değil; tablo bunu öğretiyor.
Son üç satır tabloyu kapatıyor: Gemini 3.8 Flash 68.9 puanla $0.210, Muse Spark 1.3 66.6 puanla $0.267, Kimi K3 65.7 puanla $0.614. Zirveden fark 21 ile 24 puan, fatura Luna tarafının 13 ile 38 katı. Benim gözümde bu üç satır elenme nedeni değil, uyarı: genel LLM listelerinde parlayan adlar tasarım vitrininde sönük kalabiliyor. Görev türü değişince benchmark sıralaması da değişiyor, bunu not ediyorum. Her model her vitrine uymuyor.
Benim tercih mantığım
Toparlarsam benim kuralım üç satır: kısa ve doğrulanabilir işte Luna ya da Haiku 5.5 denerim, 100 bin jetonu aşan işte Luna tarafında kalırım, vitrin finalinde Sol ya da Sonnet tarafına çıkarım. beam.ai incelemesindeki yönlendirme düzeni de aynı fikri veriyor: ucuz model dener, hakem doğrular, takılan iş büyüğe yükseltilir. open-design.ai tablosu bana şunu öğretti: 90 puan ile 83 puan arasındaki farkı müşteri nadiren görüyor, faturadaki 24 kat farkı ise her ay görüyor. Yapay zeka giderinde marifet zirveyi almak değil, doğru kademeyi seçmek.
| Ölçüt | Sonuç |
|---|---|
| Zirve skor | GPT-6.1 Sol 90.1 |
| Verim lideri | Luna 83.1 / $0.016 |
| Vurgulanan | Haiku 5.5 82.2 / $0.018 |
Videodaki anahtar anlar
AI yorumu
“Bu tabloya bir saat baktım ve fikrim net: zirve ile orta sıra arasındaki fark parayla kapanmıyor, akılla kapanıyor. Pahalı model her işe sürülmez; ucuz katman artık vitrin işi çıkarıyor, ben de tercihimi buna göre yapıyorum.”
AI değerlendirmesi
En güçlü karşı fikir şu: bu tablo tek vitrin ölçüyor, genel yapay zeka gücünü değil. Tasarım arenasında 90 alan model uzun soluklu ajan işlerinde ya da bilgi sınavında aynı sırada durmayabilir. artificialanalysis.ai Intelligence Index tarafında Sonnet 5.5 56 ile zirve bandındayken tasarım arenasında 86.8 ile üçüncü; iki ölçüm farklı meziyet tartıyor. Tabloyu genel benchmark sanmak yanlış olur, ben de bu hataya düşmüyorum.
Eksikler de açık: hız, gecikme, dil desteği ve uzun bağlam davranışı tabloda yok. Artifact başına gider tahmini; benim gerçek faturam istek sayısı, cache isabeti ve çıkış uzunluğuna göre değişir. 100 bin eşiğini aşan Haiku isteğinde fiyat beş katına çıkıyor, bunu tablo hücresi göstermiyor. anthropic.com sayfasındaki iki kademeli liste bu yüzden kritik. Tabloyu okurken hücreyi değil, dipnotu ve liste sayfasını hevesle inceliyorum.
Olası çıkar tarafını da not ediyorum: open-design.ai sayfası 21 ajan ile çalışan bir indirme sayfasına açılıyor, en iyi değer rozeti Luna tarafında. Bu kurgu ölçümün tarafsızlığına gölge düşürmez, ama tercihimi tek tabloya bırakmıyorum. venturebeat.com, artificialanalysis.ai ve beam.ai kayıtlarıyla çapraz okuma yapıyorum. Benim ilkem: tek tablo merak uyandırır, üç tablo karar verdirir.
Okur için çıkarım sade: vitrin denemeni Luna ile yap, toplu üretimde Haiku 5.5 tarafını hakemli düzende kullan, final jürisine Sol ya da Sonnet tarafını çıkar. 100 bin jeton sınırını izle, cache okuma oranını yüksek tut. openrouter.ai anlık fiyatları haftalık değişiyor, listeye ayda bir bak. Ben bu düzende hem vitrin kalitesini hem ay sonu faturasını koruyorum.
Kaynaklar
8 bağlantı; 2 tanesi 7 başka haberde de kullanılıyor. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.
- @youtube.com YouTube — OpenDesign quality-cost ranking
- @open-design.ai OpenDesign — Quality ranking and cost
- @www.anthropic.com Anthropic — Introducing Claude Haiku 5.5
Aynı kaynağı kullanan: Aynı Etiket Farklı Fatura: Haiku 5.5 ile Luna Düellosu · Haftanın Yapay Zekâ Ürünleri: Açık Agentler, Yonga Finansmanı ve Arayüz Yarışı · Grokbot Rakip Modellere Açılıyor, ChatGPT Görsel Yanıtlara Geçiyor: Haftanın Yapay Zekâ Özeti · Haiku 5.5: Anthropic sonunda küçük model sorununu çözdü · Haftanın Yapay Zekâ Tablosu: Ucuz Modeller, Görsel Yanıtlar, Ajan Yağmuru · Haiku 5.5 Maliyet Verimliliğini Yeniden Çiziyor · Claude Haiku 5.5: Anthropic'in En Ucuz ve En Hızlı Modeli Dengeleri Değiştiriyor
- @artificialanalysis.ai Artificial Analysis — Haiku 5.5 release analysis
Aynı kaynağı kullanan: Aynı Etiket Farklı Fatura: Haiku 5.5 ile Luna Düellosu
- @venturebeat.com VentureBeat — GPT-6.1 Sol launch
- @openrouter.ai OpenRouter — Grok 4.7 vs MiMo Flash
- @www.yottalabs.ai Yotta Labs — Flash models compared
- @beam.ai Beam — Haiku 5.5 subagent costs
yapay zeka · model · benchmark · ajan · llm