Tek bir RTX 3090 ile 27 milyar parametreli bir model çalıştırmak mümkün mü? Digital Spaceport'un yanıt aradığı soru tam olarak bu. Kanalın en sık gelen isteği olan tek kart veya iki küçük kartla en iyi modeli çalıştırma fikri, bu bölümde PrismML'in ternary tabanlı Bonsai 27B'si üzerinden test ediliyor. Başlıktaki %98 iddiası da testin çıpası: model dokuz kat küçülmüş halde tam hassasiyetli Qwen3 27B'nin neredeyse tamamını koruyor mu?
Ternary Nedir — Üç Değerle Dokuz Kat Küçülme
Ternary kavramı kulağa basit geliyor: her ağırlık için yalnızca -1, 0 ve +1 değerleriyle temsil. İkili sıkıştırmanın iki durumuna karşılık üç durum kullanmak, ölçek başına düşen hatayı azaltıyor. Sonuç, PrismML'in paylaştığı sayılarda net: 16-bit düzende yaklaşık 54 GB yer kaplayan 27B model, ternary düzende 5,9 GB'a, ikili düzende ise 3,9 GB'a iniyor. Hesap kabaca dokuz kat küçülme demek ve 24 GB'lık bir kartın bütçesine tam sığmak demek.
Bu küçülmenin altı boş değil. Bonsai ailesi Qwen3 27B'yi taban alıyor, hibrit dikkat yapısının yaklaşık %75'ini lineer katmanlara çeviriyor ve 262 bin token bağlamı cihaz üzerinde pratik kılıyor. Dil ağı uçtan uca sıkıştırılmış: gömme katmanları, dikkat projeksiyonları, MLP'ler ve LM başlığı aynı düşük bit gösterimde; kaçış için yüksek hassasiyetli bir köşe bırakılmıyor. Görme kulesi ise 4-bit HQQ ile ayrı paketleniyor, vision girişini metinle birlikte işliyor. Üstüne DSpark spekülatif kod çözücünün kayıpsız hızlandırma katmanı ekleniyor.
Tezgâh — Proxmox LXC ve Tek 3090
Kurulum sahnesi tanıdık bir self-hosting düzeni: Proxmox 9 üzerinde 118 numaralı LXC konteyneri, Prox 2 makinesinde. Hugging Face indirmesi hızlı, model küçük olduğu için anahtar atlanabiliyor. Komut, PrismML deposundaki llama sunucu başlatıcısı üzerinden veriliyor. Burada kritik detay, llama.cpp'nin henüz upstream'de bu düşük bit çekirdeklerini içermemesi; doğru çıktılar için PrismML'in çatallanmış dalını çekmek gerekiyor. Ortam değişkenlerinde BONSAI_HOST ile yerel adres 0.0.0.0'a bağlanıyor, temas boyutu otoda bırakılıyor, spekülatif ve KV önbellek daraltma bu testte kapalı tutuluyor.
Yükleme tamamlandığında kart doluluğu 16,772 GB olarak görünüyor; 24 GB'ın içinde epey boşluk kalıyor. Sunucu 192.168.1.61:8080 üzerinden erişilebilir hale geliyor. İlk hız ölçümü sohbet modunda yaklaşık 68 ila 69 token/s düzeyinde ve bir süre aynı bantta kalıyor. Karşılaştırma için önceki tam hassasiyetli Qwen3 27B denemesi dört RTX 3090 ile vLLM'de 40 token/s civarındaydı. Bağlam penceresi 131 bin olarak ayarlı; Hermes Agent gibi çok adımlı iş akışlarında daha yukarı çekmek mantıklı olacak.
Arcade Testi — Aynı Veri Seti, Farklı Çıktı
Testin omurgası adil bir kafa kafaya: daha önce tam hassasiyetli Qwen3 27B ile üretilen oyun salonu paketi, aynı istemlerle Bonsai'ye yeniden yaptırılıyor. Aracın kendisi devreye giriyor, düşünme adımları görünür şekilde tetikleniyor, istem işleme 1.250 token/s civarında başlıyor. Tek üretim 25 bin token üretiyor, istem işleme neredeyse hiç zaman almıyor, kod çözme ise 64,4 token/s'e yerleşiyor. Sonuçlar daha sonra arcade.digitalspaceport.com üzerinden yan yana karşılaştırmaya açılıyor.
Üç mini oyunun her biri farklı bir yüz ortaya koyuyor. İlk atış oyunu yalnızca yana hareket ettiriyor, düşman akışı abartılı, skor sol üstte küçük puntoda 16 bin civarında kalıyor; patron yanlış yöne ateş ediyor. Değerlendirme burada C eksi ve D artı bandında. Space Racer'da şerit değiştirmeler sert, font küçük ve zayıf, kaçış kontrolleri neredeyse oynanamaz hissettiriyor. Pixel Breaker cephesinde çit ve kedi sahnesi fena değil; müzik klişe bulunsa da oynanış daha pürüzsüz, tam ekran olmasa da kırılabilir yıldızlar beklenildiği gibi tepki veriyor.
%98 Gerçek Mi — Sahadaki Not
Videodaki nihai karne net: iki zayıf ve bir orta notla, kalite tam hassasiyetli sürümün gerisinde. Sunucu, %98 hissettirmediğini açıkça söylüyor; müzik ve seviye tasarımı gibi yaratıcı katmanlardaki pürüzler, skor tablolarındaki küçük ama hissedilir sapmalar bunu destekliyor. Bu, laboratuvardaki 15 benchmark ortalamasının 80,49'a karşı 85,0 bandında kalmasıyla, yani yaklaşık %94,6 korunumla da uyumlu bir tablo. Laboratuvar ortalaması ile tekil yaratıcı üretim metriği aynı şey değil; ikincisi daha acımasız.
Hız ve Araç Çağırma Işığı
Olumlu taraf ise hız ve araç çağırma. Sohbet akıcılığı iyi, kod dışı sohbetlerde araç çağrıları isabetli, kaçırma görülmüyor. 3090 üzerinde tek akışta 68 token/s, aynı model için 5090'da ternary 134 token/s'e, 1-bit 163 token/s'e kadar çıkabiliyor; M5 Max'te 58 ve 87 token/s değerleri raporlanmış. DSpark katmanının kayıpsız 1,34 kat hızlanması burada hissediliyor. Bu hız, tek kartı çok adımlı fakat tek kollu bir asistana dönüştürmek için yeterli eşiği veriyor.
Sınır çizgisi de bu noktada beliriyor. Yayında açıkça söyleniyor: sohbet ve tek kollu ajan işleri için tamamen kullanılabilir, fakat ajana dayalı kod geliştirme için henüz iyi bir zaman değil. Gerekçe yaratıcı ve yapısal kod üretiminde görülen kalite kaybı; uzun bağlam ve lineer dikkat mimarisine rağmen seviyeler arası tutarlılık düşüyor. İyileşme potansiyeli var mı sorusu açık bırakılıyor; çatallanmış çekirdekler upstream'e girdiğinde ve bağlam ayarı büyüdüğünde fark kapanabilir.
Pratik çıkarım donanım fiyatlarıyla birlikte okunmalı. Kanalın güncel fiyat pano verisine göre kullanılmış RTX 3090 tabanı 1.400 dolar civarında ve son günlerde yukarı yönlü; 3060 12 GB ise 300 dolar bandında. Çift 3060 12 GB konfigürasyonu ayrı bir hız testine konu ediliyor; tek 3090 ise bellek ve hız açısından zaten eşikte duruyor. Planı tek kartla kurup asistan, doküman okuma ve hafif otomasyon için bu modeli seçmek mantıklı; tam otonom kod ajanı veya görsel ağırlıklı oyun üretimini ana iş yükü yapmak için erken.
Ortalama Başarı Karşılaştırması
- Qwen3 27B FP1685.0
- Ternary Bonsai80.49
- 1-bit Bonsai76.11
| Varyant | Boyut | Ortalama | Korunum |
|---|---|---|---|
| Qwen3 27B FP16 | 54 GB | 85,0 | %100 |
| Ternary Bonsai | 5,9 GB | 80,49 | %94,6 |
| 1-bit Bonsai | 3,9 GB | 76,11 | %89,5 |
Videodaki anahtar anlar
AI yorumu
"Benim gördüğüm kadarıyla Bonsai, yoğunluk fikrini laboratuvardan çıkarıp tek kartın içine sığdırması bakımından etkileyici; yine de kod üreten ajana emanet etmeden önce yaratıcı üretimdeki zayıflamayı hesaba katmak gerekiyor."
AI değerlendirmesi
PrismML'in en güçlü iddiasını hakkıyla kurmak gerekirse tablo aslında iddialı: 15 benchmark ortalamasında ternary için 80,49'a karşı 85,0, yani yaklaşık %94,6 korunuyor; 1-bit için 76,11 ile %89,5 bandı. Matematikte 93,4'e karşı 95,3, kodlamada 86,0'a karşı 88,7, bilgi-STEM'de 77,0'a karşı 83,1 gibi dar makaslar, özellikle ajan işleri için kritik eşiğin korunduğu anlamına geliyor. Şirketin hibrit dikkat ve uçtan uca sıkıştırma anlatısı da boş değil; model 75%'e varan lineer katman ve 4-bit KV önbellek ile 262 bin tokenı cihaz üzerinde tutabiliyor. Bu çerçevede dokuz kat küçülmeyi dramatik kayıp olmadan anlatmak mümkün.
Ne var ki sahadaki arcade testi bu laboratuvar ortalamasının yaratıcı üretime birebir yansımadığını gösteriyor. Üç oyunda seviye mantığı, çarpışma ve font ölçekleme zayıf; patron yanlış yöne ateş ediyor, skor hizalaması küçük kalıyor, oynanış tekdüzeleşiyor. Yalnızca 25 bin tokenlık tek bir üretimden genelleme elbette temkin ister, fakat iki zayıf ve bir orta not, %98 hissinin değil %94-95 bandındaki gerçek korunumun daha dürüst bir pazarlama çerçevesi olduğunu düşündürüyor. Üstelik test llama.cpp çatallı dalı ve 131 bin bağlamla yapıldı; upstream ve daha geniş bağlam farkı kapatabilir ama bugün için çatala bağımlılık bir maliyet.
Çıkarım kısmı da doğrulamaya muhtaç. PrismML'in paylaştığı 54 GB'tan 5,9 GB'a düşüş, 16,77 GB doluluk ölçümü ve 68-69 token/s hızıyla birlikte hız tablosu tutarlı: 5090'da ternary 134 token/s, 1-bit 163 token/s; M5 Max'te 58 ve 87 token/s. Bunlar bağımsız panolarda tekrar edilebilir, carved in stone değil. Ekosistem tarafında fiyatlar da hızlı oynuyor: 1.400 dolarlık kullanılmış 3090 son günlerde yukarı gitmiş; bu, tek kartta 27B hesabını yarın daha pahalı kılabilir. Metodoloji için bir de kör nokta var: çok dilli, uzun belge ve alet zinciri testleri bu bölümde yok, arcade tek başına ajantik yetkinliği kanıtlamaz.
Pratikte seçim, işi net tanımlamaktan geçiyor. Günlük sohbet, doküman üzerinden soru yanıt, ekran ve doküman gören hafif otomasyon ve tek kollu Hermes tarzı ajan akışları için Bonsai 27B bu haliyle bile kullanışlı: yerel çalışıyor, veriniz cihazda kalıyor, marjinal maliyet sıfır ve hız yeterli. Çok adımlı kod ajanı, uzun süreli oyun seviyesi üretimi veya yüksek sadakatli yaratıcı üretim ana yük olacaksa tam hassasiyetli Qwen3 27B veya bulut sınır modeli hâlâ daha güvenli liman. Çift 3060 12 GB yolu bütçe dostu bir B planı; yine de sürücü ve çatallı çekirdek gereksinimini hesaba katmadan kutudan çıkan deneyim beklemeyin.
Kaynaklar
7 bağlantı; bunları kullanan başka yayımlanmış haber yok. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.
- @youtube.com YouTube — Bonsai 27B Gerçekten Qwen3 27B'nin %98'i mi?
- @prismml.com https://prismml.com/news/bonsai-27b
- @docs.prismml.com https://docs.prismml.com/models/bonsai-27b
- @huggingface.co https://huggingface.co/prism-ml/Ternary-Bonsai-27B-gguf
- @huggingface.co https://huggingface.co/prism-ml/Bonsai-27B-gguf
- @gate.com https://www.gate.com/news/detail/prismml-releases-bonsai-27b-39-gb-ai-model-runs-on-iphone-22620494
- @digitalspaceport.com https://digitalspaceport.com/gpus
bonsai 27b · ternary 1.58-bit · qwen3 27b · rtx 3090 · llama.cpp