Gündeme dön

Evdeki 125 Milyar Parametre: Strata 12 GB Kartta Saniyede 93 Jetona Nasıl Ulaştı

125 milyar parametreli Qwen 3.8 Flash-Next, Strata adlı yeni çıkarım motoruyla 12 GB oyuncu ekran kartında saniyede 93 jetona koşuyor. Başlıktaki 6 kat iddiasının dürüst karşılığı 2-2,5 kat; asıl sınır ise ekran kartı değil, 64 GB sistem belleği.

Nodesdaily’e aktarım: (UTC+03:00)
YouTube'da izle — m0VHx73SAG0
Okuma seçenekleri

Bu tarayıcıda cihazdan sesli okuma kullanılamıyor.

Kavram merceği

Bu görünümde geçen teknik kavramlardan birini seç. Genel tanımı, öğretici örneği ve haberdeki kullanımını birlikte oku.

Bu görünümde sözlüğümüzdeki kavramlardan biri bulunmadı. Sözlük henüz tüm terimleri kapsamıyor.

Üç dakika boyunca dönen bir imlece bakmak, fan çığlıkları eşliğinde koca bir modelden tek kelime beklemek: konuşmacının birkaç hafta önceki hali tam olarak buydu. Tüketici bilgisayarında 125 milyar parametreli bir modeli llama.cpp ile çalıştırmayı denemiş, iyi günde saniyede 15 jeton ve uzun istemlerde üç dakikayı aşan ilk yanıt süresi almıştı. Sonra 24 Eylül tarihinde GitHub üzerinde Strata belirdi ve 12 GB ekran kartında saniyede 93 jeton gibi sayılar konuşulmaya başlandı. İlk bakışta klasik küçük resim matematiği gibi duran bu iddia, modelin iç mimarisi anlaşılınca ciddiye alınması gereken bir mühendislik öyküsüne dönüşüyor.

Tam duyarlıkta 354 GB olan Qwen 3.8 Flash-Next, 12 GB kart belleğinin yaklaşık 29 katı büyüklüğünde; yani bir yolcu gemisini mutfak penceresinden geçirmeye çalışmak gibi bir iş. Strata buna rağmen Windows tarafında çift tıkla, Linux tarafında tek betikle kuruluyor, sisteme uygun dosyaları bulup yaklaşık 70 GB indiriyor ve bir sohbet penceresi açıyor. Aynı motor, OpenAI ve Anthropic ile aynı API uçlarını sunduğu için Claude Code gibi araçlar doğrudan yerel makineye bağlanabiliyor. Sekiz günde yaklaşık 4900 yıldız toplayan proje, forumlarda kullanıcıların kendi hız rakamlarını paylaştığı canlı bir dalga yarattı. Ekran görüntüleri ve hız tabloları Strata projesinin GitHub reposunda yayımlanıyor; README içindeki ölçümler 12 GB kartta Q2_0 ile saniyede 94 jeton gösteriyor.

Jeton başına yalnızca 4 GB okuyan 125 milyar parametre

Çoğu kişinin varsayımının aksine, 125 milyar parametreli bir model her kelimede 125 milyar parametreye dokunmuyor. Strata projesinin en hızlı koştuğu 2 bitlik Q2 derlemesi 66 GB bir dosya ve bunun yaklaşık yarısı uzman adı verilen küçük uzman modüllerden oluşuyor. Modelin 48 katmanında katman başına 512 uzman var, toplam 24576 blok; her jetonda her katman 512 uzmandan yalnızca 10 tanesini ve bir paylaşılanı seçiyor. Tüm katmanlarda jeton başına 480 uzman çalışıyor, yani toplamın yaklaşık yüzde 2 seviyesi. 34 GB uzman verisinin jeton başına okunanı 0,66 GB; her zaman açık parçalarla birlikte toplam dokunulan veri 66 GB dosyada yalnızca 4 GB oluyor. Bu karışımlı-uzman yapısındaki 125B parametre ve jeton başına 6B aktiflik bilgisi HuggingFace üzerindeki Qwen sayfasında doğrulanıyor.

Dosyanın neredeyse yarısını, 29 GB bölümünü, son üç jetona göre dizine alınan 51 milyar parametreli tek bir arama tablosu oluşturuyor. Model hangi satırları isteyeceğini önceden bildiği için Strata bu tabloyu SSD üzerinde bırakıyor ve jeton başına yalnızca 16 satır, yaklaşık 23 kilobayt okuyor. Dikkat çekici olan, Qwen ekibinin bu modeli tam da böyle kullanım için tasarlamış olması: model kartı bu gömme yapısının taşımaya özellikle uygun olduğunu söylüyor. 48 katmanın 36 tanesi sohbet uzadıkça bellek tüketimi sabit kalan bir dikkat türü kullanırken kalan 12 katman en fazla 48 önceki konuma bakıyor. Bu dört yenilik GitHub üzerindeki Qwen deposunda ve AlibabaCloud mimari yazısında aynı dille anlatılıyor; Qwen ekibi bu modeli Qwen4 çalışmasının önizlemesi sayıyor.

Jeton üretilirken 48 katmanın her birinde ekran kartı iki iş yapıyor: dikkat mekanizması ve hangi 10 uzmanın gerektiğini seçen yönlendirici. Liste belli olunca kart, uzmanların hangilerini belleğinde tuttuğuna bakıyor; 12 GB kart 24576 uzmandan yaklaşık 4500 tanesini tutabiliyor. Elindekileri hemen GPU üzerinde koştururken elinde olmayanları CPU sistem belleğinde eşzamanlı hesaplıyor, sonra iki sonucu toplayıp sonraki katmana geçiyor. Test makinesinde tam tur yaklaşık 34 milisaniye sürüyor; bunun 15 milisaniyesini GPU, 13 milisaniyesini CPU harcıyor, yani iki işlemci her katmanda birbirini bekleyerek paralel çalışıyor. Karttaki 4500 uzman rastgele değil; farklı sohbetlerde en sık kullanılan uzmanların kaydından, yani bir profilden yükleniyor. İlk mesajdan itibaren okumaların yarısını karşılayan önbellek, sohbetin kendi alışkanlıkları izlendikçe yüzde 72 isabet oranına tırmanıyor. Uzman önbelleği denen bu fikir motorun ta kendisi; eski motorlar kart belleğini kıt kaynak, sistem RAM tarafını son çare sayarken Strata ikisini eş oyuncu gibi koşturuyor.

Motorun kalbi: uzman önbelleği ve tahmin katmanı

Hız kazançlarının büyük bölümünü sağlayan ikinci numara, ana modelle birlikte eğitilmiş küçük bir tahmin katmanı. Ucuz ve hızlı bir taslak gibi çalışan bu katman üç jeton ileriyi tahmin ediyor, ardından büyük model 48 katmanı tek geçişte koşturup tahminleri denetliyor. Katıldığı her tahmini tutup üstüne bir de kendi jetonunu ekleyince, pahalı geçiş başına ortalama 2,4 ile 3,2 jeton üretiliyor. Aynı makinede bu numara kapalıyken saniyede 47-57 jeton alınırken açıkken 82-92 bandına çıkılıyor. Çıktının bozulup bozulmadığı sorusunun yanıtı, ekibin testinde net: kasten yanlış tahminler dayatılsa bile metin, tahminsiz koşumla birebir aynı çıkıyor. Çoklu-jeton tahmini denen bu mekanizma, IQ ile başlayan derlemelerde GPU ve CPU tarafının aynı hesabı az farklı yuvarlaması yüzünden aynı istemde farklı yanıt verebiliyor; ekibin llama.cpp ile karşılaştırmasında jetonların yüzde 97,5 ile 99 arası aynı seçilmiş. Genel MTP desteğinin Mayıs 2026 döneminde birleştirildiği bilgisi LLMRequirements haberinde yer alıyor.

Başlıktaki 6 kat sayısına biraz dürüstçe bakmak gerek. Eylül ortasında, Strata yokken, projenin yazarı aynı bilgisayarda 3 bitlik derlemeyi llama.cpp tabanlı bir araçla koşturup saniyede 15 jeton almış; 20 bin jetonluk istemde ilk kelime 3 dakika 11 saniyede gelmiş. 18 Eylül tarihine kadar aynı kurulumu 29 jetona çıkarmışlar. Strata projesinin 93 sayılık manşet değeri ise 2 bitlik derlemede ölçülmüş; 93 sayısı en yavaş 3 bit koşumuna bölününce 6,2 bulunuyor. Oysa 3 bit ile 3 bit kıyaslanınca oran 2,1 seviyesinde. Bir kullanıcının RTX 3090 üzerinde yaptığı muhtemelen en adil testte, güncel llama.cpp 31 jetona karşı Strata 74 jeton vermiş, yani 2,4 kat; üstelik llama.cpp tarafında tahmin-denetim eşdeğeri kapalıymış. Kimse yalan söylememiş, yalnızca en yavaş taban en hızlı sonuçla oranlanmış. Kullanıcının makinesi için önemli sayı donanıma göre 2 ile 2,5 kat arası; 29 jetondan 62 jetona çıkış yine de anlamlı bir sıçrama.

Baştan bilinmesi gereken asıl sınır ekran kartı değil, sistem belleği. Daha büyük bellek daha çok uzmanı kartta tutuyor; 32 GB kart olan RTX 5090, 24576 uzmandan 17463 tanesini tutup 2 bit derlemede saniyede 179 jeton yazarken 12 GB kart olan 5070 aynı derlemede 79 seviyesinde kalıyor. Ama işin yarısını yapan CPU tarafını sınırlayan şey bellek bant genişliği : işlemci 2 bit derleme için bellekten saniyede yaklaşık 42 GB çekiyor, yani DDR5 tarafının verebildiğinin tamamı. DDR4 tarafının bant genişliği bunun yarısı olduğu için DDR4 makinede her katman turunun CPU yarısı iki kat uzun sürüyor; yepyeni ekran kartı CPU tarafını, CPU da belleği bekliyor. Test makinesinin belleği BIOS tarafında hız profili kapalıyken 5200 megatransferde çalışıyormuş; XMP ya da EXPO seçeneğini açmak 30 saniyelik ücretsiz hız demek. En kritik eşik ise 64 GB: 2 bit derleme uzmanlar için 34 GB, işletim sistemi ve diğer işler için 10 GB istiyor.

Bellek faturası ve dürüst karar

Kalitenin paraya çevrildiği yer nicemleme tablosu. Nicemlenmiş dosyaları üreten ekip tam modelle kıyaslamış: tam duyarlık canlı kod testinde 87,4 alırken saniyede 93 jeton yazan 2 bit Q2 derlemesi 81,1 seviyesinde, yani 6 puan geride kalıyor. 3 bit IQ3 ise 86,3 ile tam modelin 1 puan altında; o yüzden kod işlerinde 3 bit sürüm saniyede 62 jetonla, sohbette 2 bit sürüm öneriliyor. Ölçeği koymak gerekirse, tam duyarlıkta Flash-Next 27 milyar parametreli Qwen 3.8 modelini bir kod testinde 62,5 değerine 61,7 ile bir puandan az farkla geçiyor; yani uğruna kurulum yapılan fark zaten bir puanın altında, en hızlı derleme bir başka testte 6 puan iade ediyor. Fiyat endeksindeki tırmanış Tomshardware güncel DDR5 haberlerinde oyun konsolu fiyatlarıyla kıyaslanıyor; 64 GB DDR5-6000 sonbahar döneminde 913 dolara listelenmiş, tarihin en düşüğü 159 dolarmış. Barındırılan sürüm milyon çıktı jetonu başına 0,47 dolar olduğundan 913 dolar yaklaşık 1,9 milyar jeton alıyor; saniyede 93 jetonla bu miktarı yazmak kesintisiz koşumda 240 günden uzun sürüyor ve barındırılan kopya aynı anda birden fazla isteğe yanıt veriyor. Bu tarife PricePerToken verilerinde güncel liste fiyatı olarak doğrulanıyor.

Kapsam dışı kalan bir gelişme tabloyu değiştiriyor: 1 Ekim tarihinde llama.cpp bu modele özel çoklu-jeton tahminini birleştirdi; modelin tamamı kart belleğindeyken kod çözme 28 jetondan 44 jetona, yaklaşık 1,55 kat hızlandı. Ancak model sistem belleğine taştığında, ki izleyicilerin çoğu bu durumda, aynı özellik işleri yavaşlattı; her ek tahmin kendi uzmanlarını bellekten çekiyor ve kazançtan pahalıya geliyor. Strata bildirisi kendi kazancını 1,6 ile 1,8 kat gösteriyor çünkü uzman önbelleği bu maliyeti yutuyor. Uzman önbelleğinin kendisi llama.cpp tarafında 28 Ağustos tarihinden beri açık bir taslak; yazarı iki kartta 18,4 jetondan 24,2 jetona çıktığını ölçmüş. Strata kısmen llama.cpp kodundan doğduğu için tablo bir devirden çok, herkese açık işlenen iki özelliklik bir önde koşma yarışı. Hüküm net: 64 GB DDR5 belleği ve 12 GB üzeri Nvidia kartı zaten olan kurup kullansın; belleği sıfırdan alacak olan önce barındırılan tarifeyi denesin.

Görsel: nodesdaily AI

Videodaki anahtar anlar

  1. Üç dakikada tek kelime: yavaşlığın fotoğrafı
  2. Strata sahnede: 12 GB kartta 93 jeton
  3. Jeton başına yalnızca 4 GB okuma hesabı
  4. Katman bölüşümü: GPU ve CPU el ele
  5. Tahmin katmanı: geçiş başına 3 jeton
  6. 6 kat iddiasının dürüst matematiği
  7. Asıl sınır: 64 GB bellek eşiği
  8. 913 dolarlık bellek mi, API mi?
  9. Hüküm: kim bu gece kursun, kim beklesin

AI yorumu

"Bu işte beni heyecanlandıran hız sayısı değil, modelin evdeki donanıma göre tasarlanmış olması. Konuşmacı taban çizgisini saklamadan anlatıyor; 6 katın nereden geldiğini bilerek izleyince ortaya abartı değil, izlenecek bir yarış çıkıyor."

AI değerlendirmesi

En güçlü itiraz manşetteki sayıya: birebir derleme kıyasında kazanım 2-2,5 kat ve en hızlı derleme kodda en zayıfı. 93 jetonluk hız, tam modelin 6 puan gerisindeki bir nicemlemeye ait; kodda farkı kapatan 3 bit derleme ise 62 jetonda çalışıyor. Yani hız rekoru ile kalite rekoru aynı dosyada değil ve kurulum yapacak kişi hangisini istediğine karar vermek zorunda. Başlık matematiği kimseyi kandırmıyor ama aceleci okuru 6 kat beklentisiyle donanım sepetine yollayabilir.

Videoda eksik kalanlar da var: ölçümler tek bir makine kurulunda ve birkaç haftalık pencerede yapılmış; DDR4 kullanıcıları, dizüstü kartlar ve AMD tarafı yalnızca üstünkörü geçiliyor. Uzun vadeli kalite değerlendirmesi, ajan iş yüklerinde hata oranı ve 128K bağlamda tutarlılık gibi konular açıkta kalıyor. Ayrıca Strata 8 günlük 0.1 sürümü; arayüz, profil desteği ve hata ayıklama araçları hızla değişecektir. Konuşmacının konumu da not edilmeli: kendisi yerel çalıştırma meraklısı ve projenin heyecanını paylaşıyor, ancak sayıları şişirmek yerine taban çizgisini açıkça gösteriyor.

Okur için pratik kural basit: 64 GB DDR5 ve 12 GB üzeri kart zaten masadaysa kurulum bedava hız demek; kod için 3 bit, sohbet için 2 bit derleme seçilmeli ve BIOS tarafında bellek profili açılmalı. Bellek sıfırdan alınacaksa 900 dolarlık harcama öncesinde barındırılan API üzerinde birkaç milyon jeton denenmeli. Taşıma-odaklı mimari kalıcı değişim gibi duruyor, motorlar arası fark ise herkese açık birleştirme istekleriyle kapanıyor; izlenecek olan sayı değil yarışın kendisi.

Kaynaklar

8 bağlantı; bunları kullanan başka yayımlanmış haber yok. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.

yerel yapay zeka · strata · qwen · bellek · nicemleme · llama.cpp · donanım

Konuyu takip et

Bu haberden önce

Aynı olayla editör tarafından ilişkilendirilmiş önceki haberlerden kısa bir okuma sırası.

Kanıt ve kaynaklar

İzinli kaynak metnini, sürümünü ve köken bilgisini incele.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…