Gündeme dön

OpenDesign kalite-maliyet tablosu: 17 model, tek kazanan yok

OpenDesign tasarım arenası 17 modeli puanladı: GPT-6.1 Sol 90.1 ile zirvede, GPT-6 Luna 83.1 puanı 1.6 sentlik giderle veriyor. Ben tabloyu satır satır açtım, her puanın karşılığını ve faturasını çıkardım.

Nodesdaily’e aktarım: (UTC+03:00)
YouTube'da izle — e9c02deed78
Okuma seçenekleri

Bu tarayıcıda cihazdan sesli okuma kullanılamıyor.

Kavram merceği

Bu görünümde geçen teknik kavramlardan birini seç. Genel tanımı, öğretici örneği ve haberdeki kullanımını birlikte oku.

Bu görünümde sözlüğümüzdeki kavramlardan biri bulunmadı. Sözlük henüz tüm terimleri kapsamıyor.

17 satırlık tabloyu önüme açtım: en üstte GPT-6.1 Sol 90.1, hemen gerisinde GPT-6 Sol 89.9, üçüncü sırada Claude Sonnet 5.5 86.8 yazıyor. Ölçümün adı tasarım arenası; model vitrin çalışması üretiyor, jüri de işin bitmiş haline puan veriyor. Fatura tarafı da aynı tabloda: Sol kardeşlerde $0.382 ve $0.297, Sonnet tarafında $0.574. Bu ilk üç satırın tamamı open-design.ai kayıtlarından geliyor; sayfada her model için puan ve artifact başına tahmin yan yana duruyor.

Zirvedeki ikilinin hikayesi Eylül sonuna uzanıyor: GPT-6.1 Sol 29 Eylül DevDay sahnesinde GPT-6 Sol yerine geçti, liste $2 giriş ve $10 çıkış ile amiral Astra fiyatının beşte birinde kaldı. venturebeat.com derlemesi de aynı çizgide: Astra dengi ajan işleri ve bilgisayar kullanımı, Ultrafast kademede 300 jeton/s hıza kadar. Benim gözümde tablo burada dürüst: yapay zeka vitrininde 0.2 puan fark için %29 fazla ödeme yapılıyor. Benchmark tarafında Sol ailesi Intelligence Index 48 bandında ölçülüyor, hız da 100 jeton/s dolayında.

Sonnet 5.5 cephesi 28 Eylül sürümüyle geliyor: liste $2 giriş, $10 çıkış, cache okuma yarıya inmiş $0.10. artificialanalysis.ai ölçümü Sonnet 5.5 tarafını Intelligence Index 56 ile amiral Opus 5.5 tarafının 2 gerisinde gösteriyor, Terminal Bench 4.0 tarafında ise %70.6 ile Opus tarafını geçtiği yazıyor. Tasarım arenası puanı 86.8 olan bu model için artifact faturası $0.574 görünüyor. Benim okumam şu: tek çatı içinde kalan ekip için Sonnet tarafı güvenli liman, fatura da öngörülebilir. Ajan iş yükünde cache indirimi gideri %20 dolayında hafifletiyor.

Zirve pahalı, orta sıra akıllı

Orta sıra bu tablonun en zevkli yeri: MiMo 2.6 Flash 83.5 puanla $0.029, GPT-6 Luna 83.1 puanla $0.016, Grok 4.7 82.9 puanla $0.662 yazıyor. openrouter.ai karşılaştırma sayfası aradaki yapı farkını açık koyuyor: Grok 4.7 tarafı 500K bağlam ile $2 giriş ve $6 çıkış listelerken MiMo Flash tarafı 1.05M bağlam ile $0.10 giriş ve $0.28 çıkış listeliyor. Yani benzer benchmark bandı, 20 kattan büyük fiyat makası. Ben olsam vitrin denemesinde Grok tarafını değil, açık ağırlıklı MiMo tarafını ya da Luna tarafını denerim. Token gideri burada karar verici oluyor.

Görselde okla işaretlenen satır Claude Haiku 5.5: 82.2 puan, $0.018 fatura. anthropic.com duyurusu 7 Ekim tarihli: 100 bin jetona kadar $0.10 giriş ve $0.50 çıkış, üstünde iki kalem de beş katına çıkıyor, bağlam 1M. artificialanalysis.ai ölçümü Haiku 5.5 tarafını azami gayrette Intelligence Index 43 ile fiyat sınıfında ikinci sıraya koyuyor, görev başına $0.21 gider yazıyor. beam.ai incelemesi de aynı yönde: orta gayrette 34 puan ve $0.05 gider, alt ajan işleri için biçilmiş rol. Benim için bu satır tablonun yıldızı: Sonnet tarafının 4.6 eksiği, faturanın otuzda biri. LLM tercihlerinde bu oran az bulunur.

Astra satırı tabloyu bozan istisna: 82.7 puan, $1.61 fatura. Liste fiyatı $10 giriş ve $50 çıkış olan amiral model burada Luna tarafının 0.4 gerisinde, faturanın 100 katında duruyor. Fable 5.1 satırı daha da çarpıcı: 80.3 puan, $3.66 ile tablonun en pahalı hücresi. artificialanalysis.ai kayıtları Fable tarafını $10 giriş ve $50 çıkış ile Intelligence Index görevinde $2.37 ile $3.76 arasında giderle gösteriyor. Benim yorumum sert: genel yapay zeka gücü yüksek olabilir, ama bu arenada fiyat-performans çizgisinin çok dışında kalıyor. Model seçerken liste fiyatına değil, bitmiş iş faturasına bakıyorum.

Pahalı kanat ve alt sıra

Flash koridoru devam ediyor: DeepSeek V4.1 Flash 81.2 puanla $0.023, GLM-5.3 Flash-X 80.1 puanla $0.098 yazıyor. yottalabs.ai karşılaştırması perde arkasını veriyor: DeepSeek tarafı 552B büyüklükte $0.044 giriş ve $0.30 çıkış bandında, GLM tarafı $0.036 giriş ve $0.50 çıkış bandında listeleniyor. openrouter.ai anlık fiyatları da aynı yönde. Bu iki satır benim için Haiku-Luna ikilisinin yedeği: biri tıkanırsa diğeri devrede. Benchmark farkı 1.1 puan, fatura farkı 4 kat; burada da pahalı olan değil, akıllı kullanılan kazanıyor. Ajan döngüsünde cache okuma gideri belirleyici oluyor.

Bir alt basamakta GPT-5.6 Sol 77.6 puanla $0.544, Hunyuan H4 Preview 74.6 puanla $0.418, Qwen 3.8-Max 72.0 puanla $0.595 duruyor. open-design.ai sayfası en iyi değer rozetini Luna tarafına veriyor: zirve puanın %92 bandı, zirve giderin %4 bandı. Bu oran benim yazı boyunca kurduğum tezi taşıyor: 5 ile 13 puan gerideki model faturada 30 ile 40 kat geride. Qwen tarafı $2 giriş ve $6 çıkış listesiyle bu arenada pahalı kalıyor. Token başına ödeme ile bitmiş iş başına ödeme aynı şey değil; tablo bunu öğretiyor.

Son üç satır tabloyu kapatıyor: Gemini 3.8 Flash 68.9 puanla $0.210, Muse Spark 1.3 66.6 puanla $0.267, Kimi K3 65.7 puanla $0.614. Zirveden fark 21 ile 24 puan, fatura Luna tarafının 13 ile 38 katı. Benim gözümde bu üç satır elenme nedeni değil, uyarı: genel LLM listelerinde parlayan adlar tasarım vitrininde sönük kalabiliyor. Görev türü değişince benchmark sıralaması da değişiyor, bunu not ediyorum. Her model her vitrine uymuyor.

Benim tercih mantığım

Toparlarsam benim kuralım üç satır: kısa ve doğrulanabilir işte Luna ya da Haiku 5.5 denerim, 100 bin jetonu aşan işte Luna tarafında kalırım, vitrin finalinde Sol ya da Sonnet tarafına çıkarım. beam.ai incelemesindeki yönlendirme düzeni de aynı fikri veriyor: ucuz model dener, hakem doğrular, takılan iş büyüğe yükseltilir. open-design.ai tablosu bana şunu öğretti: 90 puan ile 83 puan arasındaki farkı müşteri nadiren görüyor, faturadaki 24 kat farkı ise her ay görüyor. Yapay zeka giderinde marifet zirveyi almak değil, doğru kademeyi seçmek.

Score per cost: value belt vs top tier
ÖlçütSonuç
Zirve skorGPT-6.1 Sol 90.1
Verim lideriLuna 83.1 / $0.016
VurgulananHaiku 5.5 82.2 / $0.018

Videodaki anahtar anlar

  1. 17 satırlık tabloyu açtım
  2. Zirve üçlüsü ve fatura farkı
  3. Orta sıra verim kuşağı
  4. Haiku 5.5 vurgusu ve 100 bin eşiği
  5. Pahalı kanat Astra ve Fable
  6. Flash koridoru ve alt sıra
  7. Üç satırlık seçim kuralım

AI yorumu

“Bu tabloya bir saat baktım ve fikrim net: zirve ile orta sıra arasındaki fark parayla kapanmıyor, akılla kapanıyor. Pahalı model her işe sürülmez; ucuz katman artık vitrin işi çıkarıyor, ben de tercihimi buna göre yapıyorum.”

AI değerlendirmesi

En güçlü karşı fikir şu: bu tablo tek vitrin ölçüyor, genel yapay zeka gücünü değil. Tasarım arenasında 90 alan model uzun soluklu ajan işlerinde ya da bilgi sınavında aynı sırada durmayabilir. artificialanalysis.ai Intelligence Index tarafında Sonnet 5.5 56 ile zirve bandındayken tasarım arenasında 86.8 ile üçüncü; iki ölçüm farklı meziyet tartıyor. Tabloyu genel benchmark sanmak yanlış olur, ben de bu hataya düşmüyorum.

Eksikler de açık: hız, gecikme, dil desteği ve uzun bağlam davranışı tabloda yok. Artifact başına gider tahmini; benim gerçek faturam istek sayısı, cache isabeti ve çıkış uzunluğuna göre değişir. 100 bin eşiğini aşan Haiku isteğinde fiyat beş katına çıkıyor, bunu tablo hücresi göstermiyor. anthropic.com sayfasındaki iki kademeli liste bu yüzden kritik. Tabloyu okurken hücreyi değil, dipnotu ve liste sayfasını hevesle inceliyorum.

Olası çıkar tarafını da not ediyorum: open-design.ai sayfası 21 ajan ile çalışan bir indirme sayfasına açılıyor, en iyi değer rozeti Luna tarafında. Bu kurgu ölçümün tarafsızlığına gölge düşürmez, ama tercihimi tek tabloya bırakmıyorum. venturebeat.com, artificialanalysis.ai ve beam.ai kayıtlarıyla çapraz okuma yapıyorum. Benim ilkem: tek tablo merak uyandırır, üç tablo karar verdirir.

Okur için çıkarım sade: vitrin denemeni Luna ile yap, toplu üretimde Haiku 5.5 tarafını hakemli düzende kullan, final jürisine Sol ya da Sonnet tarafını çıkar. 100 bin jeton sınırını izle, cache okuma oranını yüksek tut. openrouter.ai anlık fiyatları haftalık değişiyor, listeye ayda bir bak. Ben bu düzende hem vitrin kalitesini hem ay sonu faturasını koruyorum.

Kaynaklar

8 bağlantı; 2 tanesi 7 başka haberde de kullanılıyor. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.

yapay zeka · model · benchmark · ajan · llm

Konuyu takip et

Bu haberden önce

Aynı olayla editör tarafından ilişkilendirilmiş önceki haberlerden kısa bir okuma sırası.

Kanıt ve kaynaklar

Kaynak metnini, sürümünü ve köken bilgisini incele.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…