Prism ML'nin Bonsai 2 modeli, Qwen 3.8B'i turnary quantization kullanarak 6 GB'ya indirerek %98 benchmark başarısı vaat ediyor. Bu video, bu iddiaların gerçek dünya görevlerinde geçerliliğini test eder. (Kaynak: youtube.com)
Bonsai 2, her ağırlığı -1, 0, +1 değerine yuvarlayarak turnary quantization uygular ve 128 ağırlık grubu başına bir ölçek faktörü kullanır. Ayrıca, devrettiğe kıymış ağırlıkları düzeltmek için dönüşüm matrisi uygular. Bu teknikler, model boyunu 9 kat küçültürken inteligentsini koruma amacını taşır. (Kaynak: prismml.com)
Kısa ve izole görevlerde (çizim, saat depurama, refleksiyon) Bonsai 2, tam model Qwen 3.8B ile rekabet eder ve %98 ortalama benchmark skoru elde eder. Bu sonuçlar, modelin basit yanıt verebildiği senaryolar için ürütücü görünür. (Kaynak: huggingface.co)
Video, agentic döngülerde modelin yeteneğini test etmek için, modelin kod yazması, dosyaları okuması, ekran görüntüsü alması, hatalarını bulması ve düzeltmesi gereken uzun süreli projeler sunar. Bu görevlerde modelin planlama ve sürekli öğrenme yeteneği ölçülür. (Kaynak: prismml.com)
Agentic görevlerde (deliken simulasyonu, ateş gemisi balonu, güneş kaplumbağası, ISS takibi) Bonsai 2 tam çalışan bir sayfa üretemezken, Qwen 3.8B bazı gereksinimleri karşılar. Bu, modelin uzun bağlam ve manyetik görevlerde sınırlandığını gösterir. (Kaynak: prismml.com)
Bonsai 2'nin başarısızlığının temel nedenleri, aynı işlemi tekrar tekrar yapması (döngü) ve yaptığını fark etmemesidir. Günlüklerde, aracın aynı sonucu 100+ kez çağırması gözlemlenmiş; bu, modelin durum bilgisini tutarken zorlandığını gösterir. (Kaynak: llm-stats.org)
Kısa görevlerde hızlı kod yardımı için yerel modelle Bonsai 2 kullanılabilir, fakat agentic iş akışlarında tam model önerilir. Sıkıştırma, yerel çalıştırmayı mümkün kılar fakat gerçek zekâ yeterli olmayabilir. (Kaynak: github.com)
AI yorumu
"Benchmark rakamları seulsine güvenmek yanlışdır; modelin gerçek dünya görevlerdeki Performansı, özellikle uzun süreli ve bağlamı gerektiren işlerde ölçülmelidir."
AI değerlendirmesi
Özetle, Bonsai 2'nin %98 benchmark rakamı kısa görevlerde geçerliyse de, agentic döngülerde gerçek zekâ yeterli olmayabilir. Kullanıcılar, model seçiminde görev türünü dikkate almalı.
Kaynaklar
5 bağlantı; bunları kullanan başka yayımlanmış haber yok. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.
yapay zeka · model sıkıştırma · agentic ai