Büyük bağlam penceresi genelde yerel donanımı cezalandırır, ama bu test motor değişiminin bu ödünü tersine çevirdiğini savunuyor: aynı Qwen 3.8 27B IQ4XS dosyası, Ryzen 7 ve RTX 4070 Ti Super tezgahında 200.000 birimlik yapılandırılmış bağlama ulaşıp akıcı kaldı. Koşunun arkasında Token Race kanalı var ve hedef taze kısa sohbet değil uzun belge, kod deposu ve ajan oturumu işi. Ana iddia net: pencerenin verimli kalıp kalmayacağına ham video belleği değil bağlam yönetim tasarımı karar veriyor.
Puan tablosu iki boyda da tartışmasız. 100.000 bağlamda uyarlanabilir KV akışı saniyede 34,53 üretim yaparken standart llama.cpp 12,58 düzeyinde kaldı; eşleşmiş komut başına ortalama 2,83 kat üstünlük. 200.000 bağlamda uyarlanabilir yapı 33,68 değerini korurken standart yapı 8,04 düzeyine indi; fark 4,24 kat. Yazar uyarlanabilir yapının iki boyda da 11 eşleşmenin 11'ini kazandığını söylüyor, yani manşet tek elverişli girdiye değil tüm matrise dayanıyor.
Bu iş zeka incelemesi değil çıkarım motoru sonucu olarak çerçeveleniyor ve denetimler bu çerçeveyi taşıyor. Her koşuda aynı IQ4XS dosyası, eşleşmiş bağlam ayarı, tek paralel yuva, flaş dikkat, Q8_0 anahtar ve Q4_0 değer önbelleği, eşleşmiş yığın boyları ve kapalı çok-kipli yansıtıcı taşıma kullanıldı. 11 komutun her biri tamamlamada 256 üretim yaptı; karşılaştırma aynı sunum koşullarında çözümleme davranışına odaklanıyor.
100.000 bağlam ayrıntısı farkın kısa-komut yapayı olmadığını gösteriyor. Kısa girdiler uyarlanabilir tarafta 36 ile 37 bandında toplanırken standart taraf 14 bandında kaldı. Yaklaşık 17.000 girdide ikili 33,55 ve 11,17 okundu; yaklaşık 25.000 girdide 32,44 ve 10,28 geldi. 77.000 girdilik komut iki motoru da beklenen biçimde yavaşlattı ama uyarlanabilir taraf 20,09 üretirken standart taraf 5,06 düzeyinde kaldı; taşınan iş yükü gerçek uzun-bağlam durumu olduğu için bu satır önemli.
200.000 bağlam çizelgesi motor öyküsünü kapasite öyküsüne çeviriyor. 1.000 altı altı girdi uyarlanabilir tarafta 36,77 ve standart tarafta 9,06 ortaladı; 1.000 ile 10.000 arası iki girdi 36,45 ve 8,83 geldi; 10.000 ile 50.000 arası iki girdi 31,42 ve 6,68 kapandı. Kanıt noktası 77.418 girdilik komut: uyarlanabilir tarafta 14,09 ve standart tarafta 3,07, yani saf yerel kurulumları kıran türden uzun belge ya da kod tabanında 4,59 kat üstünlük.
Bellek anlık değerleri yakın kalırken işlem yerleşimi ayrıştı ve bu en öğretici ayrıntı. Uyarlanabilir taraf 100.000 bağlamda 14.606MB ve 200.000 bağlamda 14.510MB bildirdi; standart taraf 13.774MB ve 14.008MB bildirdi. Gözle görülür ayrışma GPU katmanındaydı: uyarlanabilir taraf iki boyda da 66 katmanın 66'sını kartta tutarken standart taraf 54 ve sonra 43 kaydetti. Bu örüntü, çatalın büyük-bağlam baskısını kalıcı kart yerleşiminden uzaklaştırma tasarımını destekliyor.
Düzeneğin üç parçası var: asıl anahtar ve değer tensörleri sabitlenmiş sistem belleğinde duruyor, kart sınırlı yerleşik sayfa havuzu ile aktarım halkası tutuyor ve motor bağlam büyüdükçe bu havuzu yeniden bölüyor. Çözümleme sırasında sonraki katmanların verisi o anki katman işini bitirmeden önden çekiliyor, böylece sıradaki katman sayfasını hazır buluyor. Sade dille: kart model matematiğinde kalıyor, büyüyen bağlamı sistem belleği taşıyor ve etkin çalışma kümesi video bellekten akıyor.
Komutlar da bu bellek-sırtlı tasarımla uyumlu: dizge gömme ağırlığı işlemcide duruyor, 100.000 bağlamda 1024MB ve 200.000 bağlamda 512MB akış aşaması kullanılmış. Standart koşular yerleşimi otomatik sığdırmaya bırakmış ve yapılandırılmış bağlam büyüdükçe karttaki katmanlar azalmış. Çatal belgesi aynı fikri makine başına boyutlanan parçalı CUDA KV akışı ve uyarlanabilir yeniden bölme olarak anlatıyor. Dürüst uyarı daireyi kapatıyor: büyük bağlam bedava değil, aktarımlar gerçek iş yapıyor; 1024 ve 512MB değerleri tezgah başına yeniden doğrulanacak başlangıç noktası.
200K bağlamda üretim hızı
- Uyarlanabilir33,7
- Standart8,0
| Kurulum | 100K ort. | 200K ort. |
|---|---|---|
| Uyarlanabilir | 34,53 tk/sn | 33,68 tk/sn |
| Standart | 12,58 tk/sn | 8,04 tk/sn |
AI yorumu
"Ben bu sonucu model değil motor hikayesi olarak okuyorum ve onu haber yapmaya değer bulmamın sebebi tam olarak bu ayrım."
AI değerlendirmesi
En güçlü karşı okuma şu: standart llama.cpp aynı işi bitirdi, yani fark yetenek değil hız ve kullanılabilirlik farkı. Tom's Hardware Qwen 3.8 27B testinde ters yönden aynı derse vardı: 17GB'lik ağırlığı VRAM havuzuyla karşılaştırmak, motor ve sistem ilk üretim süresi ile kalıcı üretim hızını kanıtlamadan pek şey anlatmıyor. 2026 üst-sürüm yeniden yazımı da aynı yöne işaret ediyor; başlık-bitişik KV düzeni 8K üstü girdilerde dağınık okumaları kaldırıyor. Ben bu videoyu aynı yönde bir veri noktası sayıyorum: üretim hızında güçlü, ama yine de tek tezgah ve tek yuva ölçümü.
Başlıca yöntem çekincem kapsam: komut başına 11 girdi ve 256 üretim, çözümleme davranışını ölçer; ilk üretim süresini, önden işlemeyi ya da çıktı niteliğini ölçmez. Kurulum anahtar önbelleği Q8_0 ve değer önbelleğini Q4_0 düzeyinde sabitliyor; topluluk rehberleri Q8_0 düzeyinin KV belleğini yarı yarıya indirdiğini ve büyük modellerde küçük şaşkınlık etkileri bildirdiğini aktarıyor, ama bu ödünleşim bu koşuda yeniden ölçülen bir şey değil, dış bağlam. MicroCenter uyarısı burada doğru fren: önbellek katmanlarını sistem belleğine taşımak uzun oturumu ayakta tutar ama etkileşimli kullanımda son çaredir; üretim hızı zaferi yine de gecikme ve his kontrolü ister.
Doğrulanabilirlikte ölçülen sayılarla düzenek öyküsünü ayırıyorum. Dört ortalama ile 77.418 girdilik eşleşme somut ve ilke olarak yinelenebilir; ama katman sayıları, 14,6 ve 14,0GB anlık değerleri ve özellikle 1024MB ile 512MB aşama boyları sisteme özgü. Yazar bunu açıkça söylüyor: aşama, modele, bağlam uzunluğuna, karta ve belleği paylaşan diğer işlere göre ayarlanıp doğrulanmalı. 4 kat söylemini bu çatala özgü genel özellik gibi aktarmadan önce benzer bir 16GB kartta bağımsız tekrar görmek isterim.
Pratik hükmüm dar ama olumlu: bu yol, IQ4_XS dosyasını zaten çalıştıran ve uzun belgeleri, kod depolarını ya da ajan oturumlarını verimli tutmak isteyen 16GB sahibine uyar. Çok yuvalı sunuma, üretim-hacmi duyarlı işe ya da 262K pencerenin tamamını payla isteyenlere uymaz; Tom's Hardware ölçümleri orada iki 5090 ya da 48GB üstü karta işaret ediyor. Yazarın aşama değerlerinden başlar, kendi makinemde doğrular ve standart derlemeyi birinci gün silmek yerine taban çizgi olarak tutardım.
Kaynaklar
6 bağlantı; bunları kullanan başka yayımlanmış haber yok. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.
- @youtube.com Token Race — bölüm videosu
- @orcarouter.ai https://www.orcarouter.ai/blog/qwen-3-8-27b-gguf
- @tomshardware.com https://www.tomshardware.com/tech-industry/artificial-intelligence/benchmarking-qwen-3-8-27b-on-rtx-5090-and-beyond-vram-capacity-alone-cant-overcome-severe-software-and-inference-engine-bottlenecks
- @dev.to https://dev.to/rosgluk/kv-cache-on-16-gb-gpus-making-long-context-actually-fit-3789
- @github.com https://github.com/ggml-org/llama.cpp/issues/19158
- @mlsystemsreview.com https://mlsystemsreview.com/llama-cpp-2026-rewrite/
qwen 3.8 27b · llama.cpp · kv önbellek · rtx 4070 ti super · uzun bağlam · yerel yapay zeka