Gündeme dön

Ciddi Yerel Yapay Zeka 16GB ile Mümkün: RTX 5060 Ti ve Sıkıştırılmış 27B Model

RTX 5060 Ti 16GB, GSQ-RCO ile sıkıştırılmış 27 milyar parametreli modeli 64 bin token bağlamda koşturup 45,6 token/sn üretiyor. 5090 tarafında aynı model 262 bin bağlam ve çift paralel ajan açıyor. Benim gördüğüm, 16GB eşiğinin ciddi yerel ajan işini artık taşıdığı yönünde.

Nodesdaily’e aktarım: (UTC+03:00)
YouTube'da izle — qILTuXLxfBM
Okuma seçenekleri

Bu tarayıcıda cihazdan sesli okuma kullanılamıyor.

Kavram merceği

Bu görünümde geçen teknik kavramlardan birini seç. Genel tanımı, öğretici örneği ve haberdeki kullanımını birlikte oku.

Bu görünümde sözlüğümüzdeki kavramlardan biri bulunmadı. Sözlük henüz tüm terimleri kapsamıyor.

Manolo Remiddi bu videoda alışılmadık bir tercih yapıyor ve güç kaynağını değiştirmeden kasasına takabildiği en güçlü seçenek olarak RTX 5060 Ti 16GB alıyor. Açılıştaki iddiası büyük: bu küçük kartın onun tüm yerel yapay zeka düzenini değiştirdiği ve aynı değişimin benzer bütçedeki izleyiciler için de mümkün olduğu. Benim okumam, videonun bir kutu açılışından çok bir eşik deneyi olduğu yönünde.

Piyasadaki yerleşik kanı, ciddi bir yerel model için 24GB ve üzeri belleğin şart olduğu yönündeydi. Yazarın elindeki RTX 5090 32GB, bant genişliği ve hız tarafında bu kartın birkaç kat önünde konumlanıyor. Bu zeminde 8GB bellek ancak özelleşmiş küçük işlere yeter görülüyordu. İlk makul aday olarak Google tarafının 12 milyar parametreli modeli öne çıkıyor.

Asıl kırılma, 27 milyar parametreli Qwen varyantının GSQ-RCO yöntemiyle sıkıştırılmış GGUF sürümüyle geliyor. GSQ her tensörün hassasiyetine göre farklı bit derinliği seçiyor, RCO ise sabit bellek bütçesini tensörler arasında paylaştırarak hedef boyuta iniyor. İddia, bu sıkıştırılmış sürümün tam duyarlıklı sürüme yakın görev başarımı verdiği yönünde. Öyle ki yazar bu sürümü büyük kartındaki ana modelin yerine koyuyor.

Boyut merdiveni videonun en somut kısmı. En küçük 8,4GB ağırlık 8GB karta sığmıyor, 12GB kart çalıştırıyor, 16GB kart ise önerilen kayıpsız görev profilini açıyor. 11,8GB model ağırlığına yaklaşık 0,9GB ek yük, görsel kodlayıcı ve izdüşüm katmanı ile 0,35GB çoklu-token tahmini ekleniyor. Bu dizilimde kart 40 token/sn bandına çıkıyor ve toplam sistem maliyeti bin dolar bandında kalıyor.

Donanım esnekliği sorusu da ajanlar aracılığıyla yoklanıyor. Apple Silicon, AMD ve Intel tarafında çalışacağı yanıtı alınıyor. Saf işlemcide çalıştırma ise pratik dışı kalacak kadar yavaş bulunuyor. Bu tablo, kurulumun tek satıcıya kilitli olmadığı anlamına geliyor.

Büyük karttaki ölçek bambaşka bir pencere açıyor. Aynı model 5090 üzerinde 262 bin token bağlamla ve iki paralel ajan oturumuyla koşuyor. Önceki Q6 diziliminde tek ajan ve 131 bin token sınırı vardı. Saniyede yaklaşık 30 ek token kazancı da cabası. Geniş bağlamın getirisi, daha seyrek özetleme ve ham veriyi daha uzun süre bellekte tutma olarak anlatılıyor.

Hız deneyleri 400 tokenlik hikaye yazımıyla yapılıyor. Büyük kart 136 token/sn bandını görürken 5060 Ti 45,6 token/sn üretiyor. 64 bin token bağlamda kartın 15,9GB alanının 15,1GB kadarı doluyor. Küçük kartın fanı daha tiz ve yüksek devirli bulunuyor. Yazarın hükmü, küçük işlerde hissedilir bir fark kalmadığı yönünde.

Yetenek tarafında çıta yükseltiliyor ve üç ayrı siteyi gezip başlıkları toplayan, yerel bir HTML rapor üreten bir tarayıcı görevi veriliyor. Model siteler arasında dolaşıp veriyi doğru topluyor ancak rapor dosyasını kendiliğinden diske yazma adımında bir engele takılıyor. Bu noktada yazarın kendi Chromium eklentisi olan ajan sistemi, eğik çizgili hazır prompt kütüphanesi ve bilgisayar-kullanım kipiyle devreye giriyor.

İkinci inşa daha da iddialı: Jungcu arketiplerle tarot eşlemesini anlatan fool.im sitesi. Kart seçme, kart okuma ve kullanıcının yazdığı hikayeyi arketipler üzerinden yorumlama barındırıyor. Yazar siteyi GitHub üzerinde yayına aldırıp alan adı bağlantısını da ajana kurduruyor. Arka planda 3.400 kişiyi aşan bir topluluk ve günlük buluşmalar var.

Kapanıştaki tablo dengeli. Uzun soluklu işlerde büyük kart, daha seyrek özetleme sayesinde ham veriyi koruyup öne geçiyor. Küçük işlerde iki kurulum arasında pratik fark kalmıyor. Yazarın vardığı sonuç, 16GB belleğin artık ciddi yerel çalışma için yeterli olduğu ve bu sıkıştırılmış modelin günlük sürücüye terfi ettiği yönünde.

Hikaye yazım hızı

  • 5060 Ti 16GB45,6 t/sn
  • 5090 32GB136 t/sn
Aynı 400 tokenlik görevde ölçüldü.
Ölçü5060 Ti 16GB5090 32GB
Bellek16 GB32 GB
Hikaye hızı45,6 token/sn136 token/sn
Bağlam64 bin token262 bin token
Sistem bedeli~1.000 dolar~7.000 dolar

AI yorumu

"Benim açımdan bu videonun değeri kutu açılışında değil, 16GB eşiğini ölçülebilir kılması: küçük kart küçük işte büyük kartla eşitleniyor, uzun işte bağlam genişliği konuşuyor."

AI değerlendirmesi

En güçlü itirazı cömertçe kurayım: tek bir üreticinin kendi tezgahındaki ölçümü, genelleme için zayıf zemin taşıyor. Soğutma, güç sınırı ve karttan karta değişen fan karakteri sonuçlara sessizce karışıyor. 64 bin ile 262 bin token bağlam farkı küçük görevlerde görünmez oluyor. Bu yüzden küçük işteki eşitlik, büyük işteki üstünlüğü perdeleyebilir.

Videonun değinmediği metodoloji sınırları bağımsız ölçümlerde ortaya çıkıyor. 4-bit sıkıştırma görevlerde tutunurken 1-bit rastgele tahmin bandına çöküyor. Çoklu-token tahmin başlığının kalibrasyon verisinde kör nokta taşıdığı belgelenmiş durumda. Görsel eklenti ve anahtar-değer önbelleği gigabaytlar düzeyinde ek yük bindiriyor. Uzun muhakemede bozulan sıkıştırma, hikaye yazım testinde görünmüyor.

Çıkar ve doğrulanabilirlik katmanını atlamam. Anlatan hem modelin hem ajan ürününün savunucusu konumunda. 429 dolar liste fiyatı, 448 GB/sn bant ve 40 token/sn gibi rakamlar karar anında bağımsız teyit istiyor. Bölgesel fiyatlar ve sürücü farkları tabloyu hızla değiştiriyor. Benim notum, özellikle yüzde 56 hız iddiasının ikinci bir kaynakla doğrulanması gerektiği yönünde.

Pratik çıkarımım net. Bütçeyle yerel ajan koşturmak isteyen, tek oturumda orta bağlamla çalışan ve fan sesini tolere eden kullanıcı için bu kurulum güçlü bir değer. Çift paralel uzun bağlam, sessiz stüdyo ya da kesintisiz doğruluk isteyen için büyük kart tarafı yerinde duruyor. Ben olsam 16GB dizilimini giriş bileti sayar, kritik işi yine geniş bağlamda tutardım.

Kaynaklar

9 bağlantı; 1 tanesi 2 başka haberde de kullanılıyor. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.

rtx 5060 ti · 16gb vram · qwen3 27b · gsq-rco · yerel yapay zeka · donanım · nodesdaily

Konuyu takip et

Bu haberden önce

Aynı olayla editör tarafından ilişkilendirilmiş önceki haberlerden kısa bir okuma sırası.

Kanıt ve kaynaklar

İzinli kaynak metnini, sürümünü ve köken bilgisini incele.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…