Milyon token bir arada tutulan birkaç kalın kitap demek ve bu model bunu cebe sığan bir boyutta vaat ediyor. Ücretsiz, 4 milyar parametreli bu sürümün sıkıştırılmış dört bitlik dosyası yalnızca 2,6 GB. Soru da tam burada başlıyor: ekran kartı olmayan sıradan bir bilgisayar bu şeyi gerçekten çalıştırabilir mi? Kısa cevap ortadan ikiye bölünüyor. Model açılıyor, evet; ama tam milyonu günlük işte kullanmak, hayır.
Modelin kimliğine bakınca tablo netleşiyor. iFLYTEK Spark ekibinin açık lisanslı bu sürümü, 1,7 milyar parametreli küçük kardeşiyle birlikte cihaz üstünde doğal milyon pencere taşıyan nadir tasarımlardan. 200'den fazla dili kapsıyor ve verimlilik odaklı hibrit dikkat mimarisi kullanıyor: kayar pencereli katmanlarla tam dikkat katmanlarının dönüşümlü dizilişi, uzun metnin maliyetini aşağı çekiyor. Bu tasarımın ayrıntıları huggingface.co üzerindeki model kartında açıkça belgelenmiş durumda.
Ekran kartsız çalışmanın ilk şartı güncel bir çalışma ortamı. Model ilk çıktığında standart llama.cpp sürümlerinde bilinmeyen mimari hatası veriyordu, destek 6 Eylül'de resmileşti. Kartta listelenen en düşük sürümler llama.cpp, Ollama ve LM Studio için ayrı ayrı yazıyor ve üretici modeli Ollama üzerinde kendi hesabından yayınlıyor. Dosya seçimi de kritik: varsayılan etiket 8,2 GB tam dosyayı indiriyor, oysa mütevazı bellekte akıllıca olan 2,6 GB dört bitlik dosya. Bu ayrımı ollama.com üzerindeki model sayfasından teyit ettim.
Hız tarafında iki ayrı ölçü var ve karıştırılmaması gerekiyor. Okuma hızı verdiğin metni sindirme temposu, yazma hızı cevabı üretme temposu. Sekiz çekirdekli Xeon kutuda yazma saniyede 6 token civarında sürünüyor, okuma 30 ile 36 arasında. On sekiz çekirdekli ARM makinede yazma 47'ye, okuma 254'e kadar çıkıyor. İlginç olan, iş parçacığını artırmak okumaya yararken aynı ARM çipte yazmayı çökertiyor: yazma altı iş parçacığında zirve yapıp 16 iş parçacığında 7'nin altına düşüyor. Bütün bu sayılar kısa komutlardan geldi, devasa belge davranışı hakkında henüz bir şey söylemiyor. Kurulumda kolay bir tuzak var çünkü ürün milyon tavanını öne çıkarıyor. İlk testçi çalışma ortamının varsayılan ayarla tam milyona uzandığını görüp bağlam boyutunu elle kısmak zorunda kaldı. Sen de sayıyı kendin yaz, varsayılana bırakma. Bu tür sessiz varsayılanların baş ağrıttığını neuralgist.com üzerindeki Ollama bağlam rehberi de doğruluyor; istemci bellek durumuna göre küçük bir pencere seçebiliyor.
Devasa bir komutun bellekte ne tuttuğunu anlamak için modelin okurken sakladığı küçük kayıtlara bakmak gerekiyor. Her token için tutulan bu KV önbelleği , sonraki adımlarda geriye dönük bakış için kullanılıyor. Hesaba göre milyon token yalnızca önbellekte 39 GB tutuyor, modelin kendisiyle toplam 41 GB'ı biraz aşıyor. Yani 64 GB RAM'li bir masaüstü tüm belgeyi rahatça taşıyor. 32 GB makine ancak sıkıştırılmış önbellekle sığıyor ki bunun doğruluk bedeli ölçülmedi, 16 GB makine ise iki yüz bin tokende duvara dayanıyor.
Bu hesabın makul kalmasının sebebi tasarımda gizli. 36 katmanın tamamı tüm metni saklasaydı fatura 155 GB civarına çıkardı. Oysa 27 katman yalnızca son 512 tokeni tutuyor, metnin tamamını saklayan tam dikkat katmanı dokuz tane. llama.cpp de bu tasarrufu varsayılan olarak kullanıyor. Böylece standart 16 bit duyarlıkta token başına maliyet 36 KB'a iniyor: 32 binde 1,2 GB, 128 binde 4,8 GB, tam milyonda 39 GB'ın altı. Topluluk GGUF kartındaki aynı sayılar ve 128 binde dört bit sıkıştırmayla ölçülen 1,3 GB rezerv de bu hesabı tutuyor; huggingface.co üzerindeki GGUF sayfası dosya ve mimari detayını veriyor.
Bellek yetse bile asıl fatura bekleme süresinde kesiliyor. Kimse bu modelde işlemciyle uzun komut süresi yayınlamadı, o yüzden buradaki her uzun süre kısa komut hızlarından türetilmiş hesap. On sekiz çekirdekli ARM kurulumda 32 bin token yaklaşık 3 dakika, 128 bin token 20 dakika civarı, tam milyon ise aynı hızlı makinede 13 saat. Sekiz çekirdekli Xeon kutuda dört iş parçacığıyla bu süre 4 güne uzuyor. Bu katlanarak büyümenin sebebi kuadratik dikkat maliyeti : dokuz tam katmanda her yeni token, önbellekteki tüm öncekilerle karşılaştırılıyor. Hesaba göre 51 binde bu karşılaştırma modelin geri kalan işine eşitleniyor, milyonda ise 20 katına çıkıyor. Bu bellek-içi davranışın arka planını deepwiki.com üzerindeki llama.cpp önbellek mimarisi yazısı açıklıyor. Hızlı bir ekran kartıyla aradaki fark çarpıcı. GGUF'u hazırlayan kişinin ölçümünde küçük bir kart kısa komutta saniyede 1684 token okurken 131 bin tokenin tamamında 557'ye geriledi, yine de işi 4 dakikada bitirdi. Aynı iş hızlı ARM işlemcide 20 dakikalık mola, sekiz çekirdekli sunucu kutusunda iki buçuk saat. Başka bir çalışma ortamında Apple M4 Max işlemci çekirdekleriyle görülen en hızlı işlemci okuma değeri bile milyona vurulunca 9,5 saate çıkıyor. Yani RAM yeterliyse milyon pencere daha çok bir bekleme sorunu; işlemcide bugün kullanılacak aralık onlarca bin token.
Beklemeyi göze alsan bile ikinci soru cevapların sağlamlığı. Yapımcının kendi tablosunda model, soru başına 100 bin token belgeyle akıl yürütmeyi ölçen ArtificialAnalysis uzun bağlam testinde 56,3 alıyor, en yakın 4 milyar rakibi Qwen3.5-4B 57'de. İki uyarı şart: sayı bağımsız bir laboratuvardan değil satıcının kendi değerlendirmesinden geliyor ve 100 bin, milyonun onda biri. Bu eşiğin üstünde yayınlanmış geri getirme testi, akıl yürütme skoru ya da iğne bulma sonucu yok. Testin ne ölçtüğünü artificialanalysis.ai üzerindeki uzun bağlam liderlik tablosu açıklıyor.
Günlük kullanımda milyonu beklemeden önce seni yakalayacak bir tuzak daha var: düşünme kipi. Model önce gizli bir çalışma metni yazıp sonra son cevabı veriyor. Sekiz çekirdekli makinenin temposunda her bin tokenlik iç monolog 3 dakika demek. HuggingFace tartışmalarındaki bir kod görevinde model 800 tokenlik bütçeyi 233 saniyede tamamen kendi kafasının içinde tüketti, tek satır kod vermedi. Başka bir alışveriş toplamında 4 bin token sınırında takılıp matematiği bitiremedi, kip kapatılınca aynı soruyu 549 tokenle temiz çözdü. 128 bin bağlamda tek parametre adını tartışan 10 bin tokenlik bir döngü, o Xeon kutuda yarım saatlik bekleme demek. Kısa işlerde düşünmeyi kapat, derinse sabrını hazırla.
Toparlayayım: ekran kartsız bilgisayar milyon tokenlik yapay zekayı çalıştırıyor mu? Modele evet, milyona günlük pratikte hayır. İşlemcide gerçekten açılıyor ve 64 GB masaüstü kağıt üstünde tam metni taşıyor, fakat yol belirleyen bellek değil bekleme. Hızlı makinede bile okuma 13 saatlik kesintisiz fan sesi demek ve cevapların 100 binin üstünde sağlam olduğuna dair yayınlanmış kanıt yok. Tek büyük istisna donanım hızlandırma: küçük bir kart 131 bin tokeni hızlı işlemcinin 20 dakikada okuduğu işi 4 dakikada bitirdi. İşlemcide kalacaksan resmi 2,6 GB dört bitlik dosyayı güncel çalışma ortamıyla al, pencereyi on binlerce tokene çek, hızlı işlerde düşünmeyi kapat. Bu lansmanın sektör bağlamını yangtzeer.com üzerindeki iFlytek haberi veriyor: Çin'in açık kaynaklı ilk milyon tokenlik uç modeli olarak tanıtıldı.
Videodaki anahtar anlar
AI yorumu
"Milyon token kulağa sihirli geliyor ama bu testin ardından benim aklımda kalan tek sayı bekleme süresi oldu. Modelin çalışması etkileyici, fakat işlemcide tam bağlamı kullanmak günlük iş değil sabır işi."
AI değerlendirmesi
En güçlü karşı görüş şu: yavaş olması değersiz olduğu anlamına gelmez. Çevrimdışı çalışan, belgeleri makineden dışarı çıkarmayan bir model gizlilik isteyen işler için paha biçilemez. Gece boyu sürecek toplu özet işlerini sıraya koyan biri için 13 saatlik okuma bile kabul edilebilir bir maliyettir. Telefon, robot ve saha bilgisayarı gibi ekran kartı olmayan cihazlarda ajan çalıştırmak isteyenler için küçük ve açık bir modelin varlığı başlı başına kazanımdır.
Eksikler de az değil. Bir milyon tokenlik komutun işlemcideki gerçek süresi hiç ölçülmedi, elimizdeki tüm uzun süreler kısa komut hızlarından türetilmiş aritmetik. 100 bin token üstünde bağımsız doğruluk kanıtı yok, iğne bulma ve uzun akıl yürütme testleri yayınlanmadı. Sıkıştırılmış önbelleğin doğruluk maliyeti bilinmiyor ve 32 GB makinede milyon token iddiası bu bilinmeyen seçeneğe dayanıyor. Bu boşluklar kapanmadan tam pencereye güvenmek spekülasyon olur.
Konuşmacının konumunu da not edeyim: The Stack modeli kendisi çalıştırmadı, ölçümler HuggingFace sayfasındaki testçilere ve Javier Cañete rumuzlu bağımsız denemeciye ait. Uzun komut süreleri, bellek tabloları ve 51 bindeki başabaş noktası konuşmacının kendi aritmetiği. Bu şeffaflık iyi bir şey, çünkü hangi sayının ölçüldüğünü hangisinin hesaplandığını ayırt edebiliyoruz. Yine de aritmetik, gerçek donanımda çıkacak yavaşlamaları hafife alıyor olabilir.
Okur için pratik çıkarım net. Ekran kartsız bir makinede 2,6 GB dört bitlik dosyayı güncel bir çalışma ortamında kullan, bağlam penceresini on binlerce tokenle sınırla ve hızlı işlerde düşünme kipini kapat. Kütüphane ölçeğinde belge beslemek rutininse küçük bir ekran kartı seni saatlerden dakikalara indirir. Milyon token iddiasını bir yol haritası gibi oku, bugünün çalışma ayarı gibi değil; deepwiki.com üzerindeki llama.cpp bellek yönetimi notları bu hibrit önbellek tasarımının neden böyle davrandığını iyi açıklıyor.
Kaynaklar
7 bağlantı; bunları kullanan başka yayımlanmış haber yok. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.
- @youtube.com YouTube — The Stack: million-token CPU test
- @huggingface.co HuggingFace: XHToken Spark-X2.5-4B model card
- @ollama.com Ollama: SparkLLM Spark-X2.5-4B
- @artificialanalysis.ai ArtificialAnalysis: Long Context Reasoning Benchmark
- @deepwiki.com DeepWiki: llama.cpp memory management and KV cache
- @yangtzeer.com Yangtzeer: iFlytek million-token edge AI model
- @neuralgist.com NeuralGist: Ollama context window guide
yapay zeka · yerel model · uzun bağlam · cpu çıkarımı · bellek · açık kaynak