Videonun açılış iddiası net: Qwen 3.8 27B, tek bir RTX 4060 8 GB kart üzerinde koşuyor ve gösterilen tüm işler tek seferde, ajan döngüsü olmadan üretiliyor. Yazar, kurulumun yavaşlığını ve başlarda yaşadığı takılmaları saklamıyor; yine de 8 GB gibi mütevazı bir kartta bu sınıf bir modelin iş çıkarmasını şaşırtıcı buluyor. Bölümün sözü de bu: kurulumun nasıl yapıldığı, ayarların ne olduğu ve final işlerin Claude Opus ile karşılaştırması.
Arka plan olarak modelin konumu veriliyor: Qwen 3.8 yaklaşık iki hafta önce çıkmış, toplulukta hızla gündem olmuş. 27 milyar parametrelik görece küçük bir model olmasına rağmen çeşitli kodlama ve ajan benchmarklarında Opus 4.6 ile boy ölçüştüğü, yer yer öne geçtiği anlatılıyor. Çoğu kişi bu modeli 24 GB kartlarla koşmayı öneriyor; video ise daha küçük kartların sınırını yokluyor.
Kilit fikir, nicemleme tablosundan geliyor: IQ4XS sürümü taban modele yaklaşık yüzde 6 yakın performansta kalırken boyutu 14 GB bandına indiriyor. Bu da modeli 16 GB orta segment kartlara yaklaştırıyor. Videodaki soru bir adım ötesi: peki 8 GB olur mu, fazla mı yavaş kalır? Cevap için deney düzeneği kuruluyor.
Kurulum tutumlu seçilmiş: Unsloth IQ4XS indiriliyor, küçük bir proje için 70 bin token bağlam yeterli görülüyor. Bağlam belleğini kısmak için KV önbelleği 4 bite nicemleniyor, modelin yaklaşık 26 katmanı GPU üzerine aktarılıyor. Toplam tüketim 7 GB civarında tutulup işletim sistemine de nefes bırakılıyor.
İnce ayarlar devam ediyor: CPU iş parçacığı havuzu fiziksel çekirdek sayısına eşitleniyor (yazarda 6), öngörülü kod çözme MTP kipinde en fazla 2 taslak token ile açılıyor. Model yüklenince düşünme kipi etkinleştirilip akıl yürütme bütçesi kaldırılıyor; gerekçe somut, orta ölçekli bir site komutunda modelin tek başına yaklaşık 20 bin token düşünmesi. Örnekleme tarafında toplulukta paylaşılan önerilen değerler kullanılıyor: sıcaklık 1, top K 20, tekrar cezası 1, minimum P 0.
Koşum takımı seçimi 8 GB düzeneğinde kritik: gömülü sistem komutu en hafif olan araç tercih ediliyor ve tercih Pi oluyor. Mantık açık: kart zaten bellek sınırında çalışırken koşum takımının şişkinliği doğrudan bağlam ve hıza yazılıyor. Hafif takım, küçük kartın yükünü büyütmüyor.
İlk iş Minecraft temalı 3B açılış sayfası. Bir saatin sonunda üretim yazma aşamasında döngüye takılıyor; Pi, dosya yazma çağrısını yarıda kesiyor. Araştırma sonucu iki ayar bulunuyor: HTTP zaman aşımı kapatılıyor çünkü üretim hızı o kadar düşük ki normal süre sınırları işi öldürüyor; ayrıca en büyük çıktı token sayısı artırılıyor, yoksa büyük dosyalarda süreç yine kesiliyor. Komut yeniden koşuluyor ve iki buçuk saatte sonuç alınıyor: ortalama 4,2 token/sn; başta 6 civarında başlayıp bağlam uzadıkça yavaşlıyor.
Kalan üç iş daha hızlı bitiyor: Three.js ile siberpunk neon şehir sahnesi yaklaşık 1,5 saatte 5 token/sn ortalamayla; detaylı komutla kişisel site yaklaşık 2 saatte 4,6 token/sn ile; iç mimarlık şirketi açılış sayfası 1,5 saatte 5 token/sn ile. Aynı komut Opus 4.6 ile de koşulup sonuçlar yan yana konuyor; video her işte iki çıktıyı karşılaştırıyor.
Hüküm cümlesi iddialı: Qwen 3.8 yerel model cephesinde oyunu değiştiriyor. 8 GB düzeneğinde hız pratik kullanım için hâlâ yavaş bulunsa da bu boyuttaki bir modelden çıkan iş sağlam bulunuyor; bazı testlerde Opus 4.6 cephesinden iyi iş çıktığı söyleniyor. Projeksiyon da veriliyor: 16 GB kartta yaklaşık 70 bin bağlamla 12-14 token/sn bandı pratik sayılıyor.
Kapanışta merak edilen bir soru yanıtlanıyor: 8 GB düzeneğinde neden 3 bit sürüm kullanılmadı? Deneyime göre ağır CPU aktarımında 3 bit, 4 bitten daha yavaş kalıyor; ikiye bölünemeyen nicemleme türleri hız cezası yiyor. Tavsiye net: bu tür hibrit düzende 4 bit bandında kalmak daha hızlı.
Karşıt görüşü hakkıyla koyayım: tek seferlik açılış sayfası işleri yerel modelleri olduğundan iyi gösterir; ücretli sınır modellerinin farkı dağınık bağlamlı, çok dosyalı gerçek repo işlerinde ve uzun ufuklu araç kullanımında açılır. Benim deneyimimde video o senaryoyu hiç koşmuyor; bu yüzden bazı testlerde Opus cephesinden iyi sonuç hükmünü o sayfa türüyle sınırlı okuyorum.
Eksik listesi uzun: iş başına 1,5-2,5 saat duvar saati, 4-5 token/sn bandı, zaman aşımı ve çıktı tavanı gibi kırılgan ayarlar, 70 bin bağlam ile 4 bit KV ödünleşimi. 16 GB kartta 12-14 token/sn beklentisi bu bölümde ölçülmüyor, yazarın projeksiyonu olarak kalıyor; 3 bit cezası da tek düzeneğin gözlemi, genel kural diye okunmamalı.
Doğrulama tarafında tabloyu bağımsız kaynaklarla kuruyorum: IQ4XS iddiası Unsloth sayfası ve Quesma benchmarkıyla, düşünme taşması bağımsız bir aşırı-düşünme notuyla, Pi tercihi resmi belgelerle, 8 GB uygulanabilirliği harici bir uygunluk sayfasıyla test edilebilir. Videodaki yüzdeleri karar anında bu kaynaklardan tekrar kontrol ederim; nicemleme dosyaları haftalar içinde güncelleniyor.
Benim çıkarımım şu: öğrenen, deneyen ve verisini cihazda tutmak isteyenler ile 16 GB kart sahipleri için bu düzenek gerçek bir seçenek; teslim tarihi olan işler ve günlük sürücü olarak 8 GB için değil. Koşum takımına uçbirim yetkisi vermenin denetim sorumluluğu da cabası; açık kaynak takım kullanmak, çalıştırdığı kodu okuma borcunu da üstlenmek demek.
AI yorumu
"Benim gözümde bu video, yerel model tartışmasını soyut benchmark tablolarından çıkarıp gerçek bir masaya koyuyor: 8 GB kart, sabır ve doğru ayar varsa 27B sınıfı iş üretiyor."
AI değerlendirmesi
Karşıt görüşü hakkıyla koyayım: tek seferlik açılış sayfası işleri yerel modelleri olduğundan iyi gösterir; ücretli sınır modellerinin farkı dağınık bağlamlı, çok dosyalı gerçek repo işlerinde ve uzun ufuklu araç kullanımında açılır. Benim deneyimimde video o senaryoyu hiç koşmuyor; bu yüzden bazı testlerde Opus cephesinden iyi sonuç hükmünü o sayfa türüyle sınırlı okuyorum.
Eksik listesi uzun: iş başına 1,5-2,5 saat duvar saati, 4-5 token/sn bandı, zaman aşımı ve çıktı tavanı gibi kırılgan ayarlar, 70 bin bağlam ile 4 bit KV ödünleşimi. 16 GB kartta 12-14 token/sn beklentisi bu bölümde ölçülmüyor, yazarın projeksiyonu olarak kalıyor; 3 bit cezası da tek düzeneğin gözlemi, genel kural diye okunmamalı.
Doğrulama tarafında tabloyu bağımsız kaynaklarla kuruyorum: IQ4XS iddiası Unsloth sayfası ve Quesma benchmarkıyla, düşünme taşması bağımsız bir aşırı-düşünme notuyla, Pi tercihi resmi belgelerle, 8 GB uygulanabilirliği harici bir uygunluk sayfasıyla test edilebilir. Videodaki yüzdeleri karar anında bu kaynaklardan tekrar kontrol ederim; nicemleme dosyaları haftalar içinde güncelleniyor.
Benim çıkarımım şu: öğrenen, deneyen ve verisini cihazda tutmak isteyenler ile 16 GB kart sahipleri için bu düzenek gerçek bir seçenek; teslim tarihi olan işler ve günlük sürücü olarak 8 GB için değil. Koşum takımına uçbirim yetkisi vermenin denetim sorumluluğu da cabası; açık kaynak takım kullanmak, çalıştırdığı kodu okuma borcunu da üstlenmek demek.
Kaynaklar
- @youtube Red Stapler — bölüm videosu
- @northflank.com https://northflank.com/blog/qwen3-8-27b-performance-benchmarks-gpu-requirements-and-how-to-run-it
- @quesma.com https://quesma.com/blog/qwen38-27b-quantizations-benchmarked
- @huggingface.co https://huggingface.co/unsloth/Qwen3.8-27B-GGUF
- @pi.dev https://pi.dev
- @simonw.substack.com https://simonw.substack.com/p/qwen-38-27b-is-excellent-but-it-defaults
- @willitrunai.com https://willitrunai.com/can-run/qwen-3.8-27b-on-rtx-4060-8gb
qwen 3.8 · 27b · 8gb · yerel model