Gündeme dön

Haiku 5.5: Anthropic sonunda küçük model sorununu çözdü

Theo'nun incelemesine göre Haiku 5.5, 100 bin jetona kadar on sentlik fiyatıyla eski sürümü ikiye katlıyor; bilgisayar kullanımı ve ajan kodlamada Luna geride kalıyor.

Nodesdaily’e aktarım: (UTC+03:00)
YouTube'da izle — 38_6C0dkKmU
Okuma seçenekleri

Bu tarayıcıda cihazdan sesli okuma kullanılamıyor.

Kavram merceği

Bu görünümde geçen teknik kavramlardan birini seç. Genel tanımı, öğretici örneği ve haberdeki kullanımını birlikte oku.

Bu görünümde sözlüğümüzdeki kavramlardan biri bulunmadı. Sözlük henüz tüm terimleri kapsamıyor.

Anthropic büyük modellerde kod yazımı nın zirvesinde dolaşıyor. Fable ve Opus ile başlayan, Sonnet 3.5 günlerinde araç çağrılarını yazılımcıların günlük işine sokan ekip, yapay zekâ destekli geliştirmeyi bugünkü haline getiren taraftı. Ama dizide hep bir zayıf halka vardı: küçük modeller. Ekim 2025'te gelen Haiku 4.5 o gün pahalıydı, bugünse fiyat listesinde gülünç duruyor. Theo o kadar ileri gitmiş ki tüm araçlarına, ajanlarına ve kural dosyalarına Haiku 4.5'ten her koşulda kaçının talimatını işlemiş. Birkaç hafta önceki yazısında da fikrini açık yazmış: Anthropic'in kullanılmaya değer küçük modeli yok.

Eleştiri tarihsel: Anthropic neredeyse tüm gücü büyük modele veriyor, küçükleri zayıf damıtmayla geçiriyor. Önceki amiral sürümler döneminde Opus niteliği düşmüş, ara sürümler ve sönük Opus 5 bu yüzden gelmişti. Bu lanet Opus 5.5 ve Sonnet 5.5 ile kırıldı, beklenti de bugünkü Haiku 5.5'e taşındı. Küçük modelin görevi belli: dosya arama, değişiklikleri üç kez denetleme, pahalı modelin jeton yakmaması gereken her şey. Theo güveni o kadar yitirmiş ki parasını korumak için Claude'una rakip Sol modelini çağırtıyordu. Soru artık şu: Haiku 5.5 bu utancı bitirdi mi?

Fiyat ve 100 bin eşiği

Haiku 5.5'in yanıtı net: fiyat doğru, performans sağlam, küçük boyuna göre ekstra numaralar mevcut. 100 bin jetona kadar giriş jetonu milyonda 10 sent, çıkış 50 sent; eşiğin üstünde iki kalem de beş katına çıkıyor. Eski Haiku isteklerinin %90'ı 100 bin sınırını aşmıyormuş. Liste fiyatı kısa istekte %90, uzun istekte %50 indirim; yeni kodlayıcının jeton şişkinliğiyle birlikte ortalama kazanç %75 bulunuyor. Bu fiyat tablosu Anthropic duyurusundan alındı; şirket yeni modeli yüksek hacimli, maliyete duyarlı işlerin adayı olarak tanımlıyor.

Eşik tasarımının iki gerekçesi var. Bir yanda hızlı okuma ve sınıflandırma işlerini olabildiğince ucuzlatıp metin düzenleme araçlarıyla rekabet etmek; öte yanda Claude Code içinde uzun bağlamda faturayı patlatmamak için kullanımı kısa yanıtlara yönlendirmek. Takvim şöyle: 22 Eylül'de Opus 5.5, 28 Eylül'de Sonnet 5.5, şimdi Haiku 5.5 ile 5.5 ailesi tamamlandı. Çalışanlardan Lydia, faturayı düşük tutmak isteyenlere otomatik özet penceresini 100 bine sabitlemeyi öneriyor; ayar model başına duruyor ve alt ajanları da kapsıyor. Bu aile takvimi SiliconAngle derlemesinde de aynen geçiyor.

Fiyat karşılaştırması dikkat çekici: kısa bağlamda Haiku 5.5, OpenAI Luna ile sentine kadar aynı ($0.10/$0.50). 100 binin üstünde tablo dönüyor çünkü Luna artışı 272 binde devreye giriyor ($0.20/$0.75). Üstelik yeni kodlayıcı aynı metni yaklaşık %25 fazla jetona çeviriyor; başlık fiyatıyla gerçek fatura arasında gizli fark doğuyor. Yani 100 bine sığan işte Haiku fiyat-performans lideri, üstünde Luna açık ara avantajlı. Bu ayrıntı SimonWillison notlarında da vurgulanıyor; yazara göre kısa istekte fiyatlar eşit, uzun istekte Luna çok daha uygun.

Bin turluk hesap işi büyütüyor: 80 bin cache okuma, 2 bin taze giriş ve 1 çıkışlı örnek turda Haiku ile Luna tur başına 0.15 sent, Sonnet 2.2 sent. Bin turda $1.5'a karşı $22 demek. Doğrulaması ucuz işte deneme-yanılma mantıklı: Terminal ölçümünde geçme oranı Haiku %39.2, Luna %16.4, Sonnet %70.6 iken başarı başına maliyet Haiku'da 0.4 sent, Luna'da 0.9 sent, Sonnet'te 3.1 sent bulunuyor. Aynı tur fiyatı, farklı isabet oranı. Bu hesap CTOL analizinden geliyor; yazıda yönlendirme önerisi de var: ucuz model dener, doğrulayıcı hakem olur, takılan iş büyüğe yükseltilir.

Ölçümler ve zeka-dolar çizgisi

Ölçüm patlaması sert: bilgi işi GDPval'da 735'ten 1620'ye iki kattan fazla; insanlık sınavında araçsız %10.2'den %45.9'a, araçlı %18.7'den %57.4'e; bilgisayar kullanımı OSWorld'de %15.7'den %72.4'e; ajan kodlama Terminal Bench'te sıfırdan %39.2'ye. Luna kod ölçümünde %16.4'te kalıyor; Haiku iki kattan fazla önde. Görsel akıl yürütmede %6.4'ten %46.4'e sıçrama da var. Bu oranlar Anthropic duyurusundaki resmi tablodan; bağımsız bir endekste de 43 puanla küçük sınıfın lideri, ancak aynı ölçüm jeton iştahını da gösteriyor.

Bilgisayar kullanımında OpenAI uzun süre önde götürüyordu; fark kapanıyor ama karmaşık ajan kodlamada adres değişmiyor: Sonnet ve Opus 5.5. Haiku 5.5 ilk kez ayarlanabilir çaba düzeyi sunan küçük model oluyor; düşük, orta, yüksek, üst ve azami arasından kullanıcı seçiyor, zeka-maliyet dengesini iş belirliyor. Bağlam 200 binden 1 milyona çıkıyor. Canlı destek, sesli ajan , uygulama içi yardımcı ve tarayıcı işleri hız gerektirdiği için hedef listede. Bu çerçeve Technology.org derlemesinde de özetleniyor.

Zeka-maliyet grafiği en eğlenceli bölüm: Pareto çizgisi Luna, Haiku, Sonnet ve Opus üzerinden akıyor; 6.1 Sol açılınca çizgi bozuluyor çünkü 21.3 sentten 21.4 sente dev zeka sıçraması sunuyor. Luna her zaman daha ucuz ve bu sayılara göre daha zayıf. Sessiz cevher ise ağırlıkları açık Mimo: fiyatına göre şaşırtıcı iyi, çizginin üstünde kalan az sayıda seçenekten. Tek sağlayıcıda kalmak isteyen için Haiku artık mantıklı durak; abonelikleri ikiye katlamadan, birbirini anlayan modellerle çalışmak isteyen için değer.

Aynı sağlayıcı tezi pratik: Anthropic altyapısında kalan ekip, Claude Code aboneliğinin yanına ikinci abonelik eklemeden tüm işi tek çatıdan yürütüyor. Opus'un Haiku'ya verdiği yönergeyi Sol'a verdiğinden daha iyi işlediği iddiası ölçülmüş değil; ama sahada gözleniyor. Maliyet hedefi olan ekipler için tek fatura, tek arayüz, tek destek masası anlamlı. Burada karar ölçütüne başlık fiyatı değil başarı başına maliyet yazılıyor.

Demolar ve tasarım

Alt ajan düzeni değişiyor: Theo, kural dosyasındaki her şeyi Opus'a ver kuralını esnetiyor; işin küçük alt kümesini ucuza Haiku'ya bırakmak, hangi küme olduğunu Opus'un ayırt etmesine güvenmek istiyor. Henüz zorlamamış ama kuralı değiştirecek. Bu yaklaşım AICoder kaydında da yer alıyor: Claude Code 2.1.293 sürümü Haiku 5.5'i varsayılan küçük model yapıyor, bağlam 1 milyon. Özet, sıkıştırma, veri sorgusu ve sınıflandırma gibi tekrarlı işler artık ucuz katmanda.

Eğlence kısmı demolar: topluluktan Arshan'ın videosu 60 sentlik API maliyetiyle 20 dakikadan kısa sürede üretilmiş, paraya göre inanılmaz iyi. Theo'ya göre sırrın bir kısmı Anthropic modellerinin tasarım zevki; eğitim verisinin özenli seçilip budanması, modele iyi referans noktaları bırakmış. Önden tasarım denemesinde Dara'nın whichAI çalışması da aynı zevki taşıyor.

whichAI karşılaştırması Grok'a karşı açık ara: yazı tercihleri daha az utanç verici, ilk kez görülen canlandırma numaraları, üzerine gelince alttaki içeriği değiştiren blueprint paneli. Tasarım ölçeği kapatılınca klasik dil modeli çirkinliğine dönüş; farkın tasarım eklentisinden geldiği anlaşılıyor. Eklentiyi kaldırmış olan Theo geri kurmaya karar veriyor. Grok tarafı eklenti kapalıyken daha da kötüleşiyor; ilgili bölüm kahkahalarla geçiyor.

Karanlık nokta ise canlı yayında gelen kota dersi: 181 çekme isteğini paralel çeken betik saatlik 5 bin istek sınırına çarpıyor; hata gövdesini veri sanıp saklıyor, sonra JSON ayrıştırma patlıyor. Bekleme tetiklenmediği için iş ipliği öylece duruyor, Theo kilit açılana dek 50 dakika eli kolu bağlı kalıyor. Küçük modellerin kendini köşeye sıkıştırıp kullanıcıya da iş çıkarması; sunucunun küçük modellere güvensizliğinin canlı örneği.

Saha kanıtı ve sonuç

Sahadan sesler güçlü: Asana değerlendirmesinde görev tamamlama gecikmesi %30 kısalmış, ajan turu çıkarımı 2.5 kata kadar hızlanmış; mühendis Aaron Vinh gözle görülür akıcılıktan söz ediyor. HubSpot CRM denemesinde 92.8 ile o güne kadarki en yüksek puan, en hızlı tamamlama, en yüksek isabet, en düşük yanlış alarm. AlphaSense haftada 8 milyon çağrılık soru-cevap işinde 400 sorguda 0.76'dan 0.84'e anlamlı sıçrama kaydetmiş. Bu müşteri sonuçları Anthropic duyurusunda aynen yayımlandı.

Box tarafı tabloyu tamamlıyor: 11 puan fark, yarıya inen gecikme. Güvenlik tarafı sıkı tutulmuş: hizalama testinde tutarsız davranışlar Haiku 4.5'e göre çok azalmış; savunma işlerine Sonnet 5.5'ten fazla izin var, sızma denemesi yasak, geniş erişim için Siber Doğrulama Programı'na başvuru gerekiyor. Bu güvenlik çerçevesi SiliconAngle derlemesinde de aynen geçiyor; aynı derleme dağıtım kanallarını Claude Platformu, AWS, Google Cloud ve Azure olarak sıralıyor.

Aynı gün iki hediye daha: Sonnet 5.5 cache okuma yarıya iniyor ($0.20 yerine $0.10), ajan işlerinin çoğu %20 ucuzluyor. Abonelere aylık API kredisi geliyor: Max 5x $100, Max 20x $200, Team havuzda $500'e kadar; devretmiyor, etkileşimli Claude Code'da geçmiyor. Bağlam TechCrunch kaydında da anlatılıyor: Sonnet 5.5 (28 Eylül) %30 hızlı, çok ajanlı işte Opus'u geçiyor, Fable ve Opus düzeyinde siber korumada. Şirket yeni küçük modeli haftalar öncesinden haber vermişti.

Hüküm: Haiku 5.5 dar, doğrulanabilir, tekrarlı işlerin modeli ; özet, sıkıştırma, sınıflandırma, veri sorgusu ve alt ajan görevi. Planı akıllı sürüm yapar, uygulamayı ucuz seçenek dener, doğrulayıcı hakem olur. Başarı başına maliyet hesabı aynı fikirde: ucuz deneme artı seçici yükseltme. Kalem işi yine büyüklerde. Küçük model laneti ilk kez kırılmış görünüyor; Theo kural dosyasını güncellemeye hazırlanıyor.

Görsel: nodesdaily AI
ÖlçüSonuç
OSWorld %72.4Eski sürüm %15.7
Terminal %39.2Eski sürüm %0
Kısa istek girişMilyonda $0.10

Videodaki anahtar anlar

  1. Küçük model eleştirisi ve açılış tezi
  2. Fiyat tablosu ve 100 bin eşiği
  3. Ölçüm patlaması ve Luna karşılaştırması
  4. Zeka dolar grafiği ve Pareto çizgisi
  5. Alt ajan düzeni ve kural dosyası
  6. Topluluk demoları ve tasarım zevki
  7. Kota dersi ve duran iş ipliği
  8. Hüküm ve yönlendirme önerisi

AI yorumu

"Bu tabloya bakınca küçük model devri değişiyor: fiyat artık bahane değil, ölçüm konuşuyor. Yine de akıllı yönlendirme şart; körü körüne ucuz katmana yüklenmek faturayı değil hayal kırıklığını büyütür."

AI değerlendirmesi

En güçlü karşı görüş jeton iştahı: bağımsız ölçümde Haiku azami düzeyde görev başına 162 bin çıkış jetonu yakıyor; Luna benzer puanı 50 binde alıyor. Başlık fiyatı eşit, fatura eşit değil. 100 bini aşan bağlamda Luna'nın artışı da küçük; uzun işte Luna daha uygun. Kısa istekte eşit fiyat eşit yetenek değil; başarı başına maliyet Haiku lehine ama çözülemeyen işte deneme çöp oluyor.

Eksik kalanlar açık: karmaşık ajan kodlamada Sonnet ve Opus farkı sürüyor; şirket de bunu açık yazıyor. Yanlış bilgi oranı Luna'ya göre düşük (%40'a %77), bilinmeyeni itiraf eğilimi artı; ama olgusal bilgi puanı geride (%36'ya %44). Güvenlik izinleri savunmada geniş, saldırıda kapalı; denge makul ama sızma testi yapan ekip için sınır var.

Sunucunun olası çıkarı da not edilmeli: video sponsoru Coderabbit; küçük model övgüsü sponsorlu aracın işine yarar. Topluluk demoları seçilmiş vitrin; başarısız denemeler yayında yok. Yine de ölçüm tablosu resmi, müşteri adları açık, sayılar bağımsız kaynaklarla tutarlı duruyor.

Okur için çıkarım pratik: 100 bine sığan, doğrulaması ucuz işi Haiku'ya ver; otomatik özet penceresini 100 bine sabitle; faturalandırmayı izle. Uzun bağlam ve kalem iş için büyüğü tut. Tek sağlayıcıda kalmak faturayı sadeleştirir ama Luna alternatifi her zaman masada dursun.

Kaynaklar

8 bağlantı; 5 tanesi 4 başka haberde de kullanılıyor. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.

yapay zeka · claude · anthropic · llm · ajan

Konuyu takip et

Bu haberden önce

Aynı olayla editör tarafından ilişkilendirilmiş önceki haberlerden kısa bir okuma sırası.

Kanıt ve kaynaklar

Kaynak metnini, sürümünü ve köken bilgisini incele.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…