Gündeme dön

Avuç İçi PC'de 27 Milyar Parametre: Khadas Mind Pro 44 Tok/s'ye Nasıl Çıktı?

Khadas Mind Pro, Panther Lake Core Ultra X7 358H ve ARC B390 ile 27 milyar parametreli Qwen3'ü avuç içinde çalıştırdı; doğru kuantizasyon ve taslak modelle aynı kutu 5 tok/s'den 44 tok/s'ye 9 kat hızlandı.

Nodesdaily’e aktarım: (UTC+03:00)
YouTube'da izle — 1_8pzU44n-M
Okuma seçenekleri

Bu tarayıcıda cihazdan sesli okuma kullanılamıyor.

Kavram merceği

Bu görünümde geçen teknik kavramlardan birini seç. Genel tanımı, öğretici örneği ve haberdeki kullanımını birlikte oku.

Bu görünümde sözlüğümüzdeki kavramlardan biri bulunmadı. Sözlük henüz tüm terimleri kapsamıyor.

Her şey basit bir merakla başladı: avuç içine sığan bir kutu gerçekten ciddi bir yapay zeka modelini çalıştırabilir mi? Cevap evet, ama videonun sürprizi bu değil. Aynı Khadas Mind Pro, aynı Qwen3 27B modeliyle en yavaş ayar 5 tok/s'nin altında sürünürken en hızlı ayar 44 tok/s'yi gördü; okuma hızı ise 17'den 900'ün üzerine 56 kat zıpladı. Farkı donanımı değiştirmek değil, yazılımı doğru kullanmak yarattı.

Kutu Khadas Mind Pro. İçinde Intel'in Panther Lake mimarili Core Ultra X7 358H var: 16 çekirdekli hibrit yapı, 12 Xe3 tabanlı ARC B390 tümleşik grafik ve 64 GB LPDDR5X 8533 MT/s bellek, üstüne 2 TB PCIe 4.0 SSD. Intel bu platformu 180 TOPS'a kadar yerel AI hızlandırması diye konumlandırıyor. Notebookcheck'e göre cihaz testte çok yüksek CPU performansı ve önceki nesillere göre yüzde 60-80 daha güçlü iGPU sunuyor; 30-40 W civarı grafik gücüyle 50 W paket içinde çalışıyor. CES 2026'da görücüye çıkan bu tasarım, firmanın bugüne kadarki en küçük X7 kutusu.

Asıl numara modülerlikte. Khadas'ın Mind Link adını verdiği tescilli manyetik bağ, kutuyu bir yuvaya oturtup doğrudan PCIe 4.0 x8 hattı sağlıyor; yani 15.8 GB/s teorik bant. Mind Graphics 2 yuvası içinde tam masaüstü NVIDIA RTX 5060 Ti 16 GB GDDR7, 180 W GPU ve 350 W güç kaynağı var. Üstünde iki HDMI 2.1b, DisplayPort 2.1b, iki USB-A 3.2 Gen2, 40 Gbps USB-C, 2.5 GbE ve SD 4.0 okuyucu bulunuyor. Fiyat tablosu net: kutu tek başına 1.799 dolardan başlıyor ve son aylarda 2.599 dolara kadar tırmandı, yuva 1.349 dolar; sadece kart tek başına 570 dolar civarı. Bağlantı Thunderbolt 5'in 80 Gbps sınırını katlıyor, ama bu hızın ne kadarının gerçekten lazım olduğu ayrı bir soru.

Testin yükü Qwen3 27B, yani 27 milyar parametreli çok sevilen bir açık model. İlk denenen paket Q4_K_M: 4 bit'e sıkıştırılmış, K yeni ölçekleme şeması, M orta koruma demek, ağırlıklar 17.66 GB tutuyor. İkinci paket IQ4_XS: hâlâ 4 bit ama imatrix kalibrasyonuyla daha sıkı paketlenmiş, 13 GB'a iniyor ve 16 GB VRAM'e tam sığıyor. Model tek parça değil, yaklaşık 62 katmandan oluşan bir pasta gibi; llama.cpp'deki NGL bayrağı kaç katmanın VRAM'e kopyalanacağını belirliyor. Unsloth'un Hugging Face'teki GGUF paketleri bu iki sıkıştırma arasındaki pratik farkı net gösteriyor.

Yuvalanmamış halde, kutu tek başına dört yoldan konuşabiliyor: CPU, Vulkan, SYCL ve OpenVINO. Ölçülen okuma (prefill) CPU'da 17 tok/s iken OpenVINO ile 446 tok/s'ye fırlıyor, 27 kat fark. Yazma (decode) tarafı ise 2.6 ile 5.7 tok/s bandında sıkışıyor; CPU 5'in altı, Vulkan 5.4, SYCL 5.7, OpenVINO 2.6. Nedeni belli: her kelime için 18 GB ağırlığın tamamı bellekten akıyor ve tümleşik grafikte CPU ile GPU aynı havuzu paylaşıyor. Gerçek bant buradan hesaplanıyor: 17.66 GB çarpı 5.42 tok/s eşittir yaklaşık 100 GB/s. Intel'in yeni sürücüsü paylaşılan belleği yüzde 93'e kadar açsa da bu hâlâ DDR hızında paylaşımlı bellek, özel VRAM değil; bant darboğazı devam ediyor.

Darboğazı aşmanın yolu tek kelimeyi tek geçişte üretmeyi bırakmak. Buna taslak modelle spekülatif çözüm deniyor: küçük hızlı bir model birkaç kelimeyi önden tahmin ediyor, büyük model hepsini tek geçişte doğruluyor; tutan tahmin neredeyse bedava. Hugging Face'teki bazı Qwen paketleri yanında 1.5 GB'lık taslağı da veriyor. Tümleşik grafikte bu hile 5 tok/s'yi 11 tok/s'ye katladı, iki kat ve ücretsiz. İki cihazda da en iyi derinlik Nmax 3 çıktı; biri beş kat hızlı olmasına rağmen tepe aynı. Nmax 8'e zorlayınca 3.5 tok/s'ye düşüp hilesiz halinden bile yavaşladı. llama.cpp varsayılanı zaten 3, dokunmamak en iyisi.

Harici GPU takılınca işler karıştı. Model 17.6 GB, kart 16 GB; 1.7 GB taşıyor ve sığmıyor. NGL taraması tabloyu ortaya döktü: 0 katmanda 4.54 tok/s, 48 katmanda 11'e yakın, 56 katmanda 14'e yakın, sonra 60 katmanda 0.82 tok/s'ye çakılma, 17 kat düşüş ve bir duvar. Dört katman fazla yüklemek her kelimede sürücüyü katmanları içeri dışarı sürüklemeye zorluyor. Eski öğreticilerdeki NGL 99 bayrağı otomatik sığdırmayı eziyor; otomatik 10.48 tok/s verirken elle 56'da 14 tok/s alınıyor, kör bayrak 16 kat kaybettirebiliyor. Verim eğrisi yumuşak bir rampa değil, son adımda kopan bir uçurum; son katmanlar en değerlisi.

Çözüm modeli küçültmek oldu. Q4_K_M'den IQ4_XS'ye geçince 4.5 GB kazanıldı ve model tamamen 16 GB VRAM'e yerleşti. Sonuç çift kat: okuma 474'ten 943'e, yazma 14'ten 27'ye. Tek bir indirme, bütün katman taramasından daha çok kazandırdı. Peki kalite düştü mü? WikiText-2 İngilizce düzyazıda şaşkınlık skoru iki pakette de 6.8 civarı, küçük olan bir tık daha bile iyi, fark gürültü seviyesinde. Ama testin sınırı net: iki dosya farklı sıkıştırıcılardan geliyor, yani Q4 ile IQ4'ün geneli değil bu iki dosya karşılaştırıldı; skor sadece bir sonraki kelimeyi tahmin etmeye bakıyor, kod, matematik veya uzun akıl zincirini ölçmüyor. Kendi iş yükünüzü kendiniz deneyin.

Mind Link gerçekten gerekiyor mu? Kağıt üstünde 15.8 GB/s dev bir boru, pratikte üretim sırasında ihtiyaç 2 ile 19 MB/s arasında gidip geliyor, ortalaması 2 MB/s; yani borunun yüzde 0.01'i. Bu boruyu 8 bin kat yavaşlatsan bile darboğaz olmaz. Thunderbolt kağıt üstünde 5 kat yavaş, ama 5 ile 8 bin arasında dağlar var. LLM üretiminde fark yaratmıyor; oyunda fark yaratabilir. Tek istisna model yükleme: 17 GB'ı 3 saniyede taşımak gerçek veri hareketi, sonrası yerleşik kalınca bant neredeyse boşta.

Ölçümler bir gün çöpe gitti çünkü görünmez bir süreç 18.5 GB'ı rehin tutuyordu; llama-bench kapatılsa da bellekte kalmış, sonraki her okuma yarıya düşmüş. İkinci GPU belirince OpenVINO sessizce CPU'ya düşüp 30 kat hata üretti; ortam değişkeni GPU.0 istiyor, 0 olmadan çalışmıyor. Kutu içinde pil var; 30 W kablo takılıyken yoğun yükte pil yavaşça boşalıp makine kapanmış, 100 W kabloyla düzeldi. Austar marka OCuLink yuvası model VRAM'e taşınırken iki kez çöktü, sürücü dayanamadı. Linux henüz denenmedi, özel bağın sürücüsü endişe yaratıyor. Video, bu hataları bilerek anlatıyor; aynı tuzağa düşmeyin diyor.

Tüm ayarlar tek tabloda yan yana konunca manzara net: CPU yalnız 5'in altı, tümleşik 5.5, taslak eklenince 11, hariciye bölünmüş 14, tam yerleşik 27, taslak da eklenince 44 tok/s; en yavaş ile en hızlı arasında 9 kat. Okumada 17'den 900'ün üzerine 56 kat. Üç kazanç bedava: modeli sığdırmak, taslak açmak, öğreticiden kopyalanan bayrağı silmek. Tek ücretli kazanç VRAM satın almak. Ders net: bant genişliği değil VRAM alın, almadan önce modeliniz sığıyor mu kontrol edin, NGL 99'u ezbere yapıştırmayın ve taslağı tek kullanıcılı kutuda açın; iki kişi aynı anda kullanacaksa kapatın çünkü tahminler gerçek kullanıcılarla aynı geçiş için yarışıyor.

Görsel: nodesdaily AI

Yazma Hızı: 5'ten 44'e

  • CPU4.8
  • iGPU5.7
  • iGPU+Taslak11
  • dGPU bölün.14
  • dGPU tam27
  • Tam+Taslak44
Yüksek daha iyi; son iki bar VRAM'e tam yerleşme ve taslağın katkısını gösterir.
YapılandırmaYazma hızı
CPU yalnız4.8 tok/s
iGPU (Vulkan/SYCL)5.7 tok/s
iGPU + Taslak Nmax311 tok/s
dGPU bölünmüş NGL5614 tok/s
dGPU tam IQ4_XS27 tok/s
dGPU tam + Taslak44 tok/s

AI yorumu

"Benim gözümde şaşırtıcı olan çalışması değil, aynı donanımda doğru ayarlarla 9 kat fark çıkması; sığdırma ve şişme arasında VRAM'e sığdırma belirleyici oldu."

AI değerlendirmesi

Karşı argümanı en güçlü haliyle kurarsam: avuç içi kutu artı bin dolarlık yuva toplamda 3 bin doları aşıyor ve 44 tok/s verse bile bulut API hâlâ daha hızlı ve daha ucuz; ayda 10-20 dolara GPT, Claude, Gemini arasında gezmek varken bu niş hobi olarak kalıyor. Üstelik ARC B390 oyun testlerinde RTX 4050 Laptop ile kafa kafaya gelse de fiyat/performans şampiyonu değil; Notebookcheck'in de not düştüğü gibi RAM lehimli, yükseltme yok, aksesuar pahalı. Bulutun ölçek ve tazelik avantajı bu masayı tek başına deviremez.

Videoda test edilmeyen çok şey var. Perplexity sadece İngilizce düzyazıda bir sonraki kelimeyi ölçüyor; kod, matematik ve uzun akıl zinciri hasarı bu skorla görünmez, oysa 27B'yi yerel çalıştırma sebebi genelde kod. Termal throttling, fan gürültüsü, pilde çalışma süresi ve 96 GB'lık üst konfigürasyon hiç ölçülmedi. Tek model, iki dosya, iki sıkıştırıcı; genelleme için dar. Çok kullanıcılı senaryoda taslak modelin gerçek kullanıcı istekleriyle aynı geçişte yarışıp yavaşlatacağı söyleniyor ama test edilmedi; Linux tarafı da belirsiz.

Doğrulanabilirlik tarafında dikkatliyim: video Khadas sponsorlu değil ama baştan sona ürün vitrini ve ortada Abacus ChatLM reklamı var; rakamlar tek cihazda tek ölçüm. 44 tok/s iddiası tam yerleşik IQ4_XS artı taslak kombinasyonuna bağlı ve kabul oranı hızla değişir; bağımsız tekrar ölçüm ister. Fiyatlar da oynak: kutu 1.799'dan 2.599'a çıktı, yuva 1.349; 93 paylaşımlı bellek açma pazarlama cümlesi, bant genişliği hâlâ paylaşımlı ve profesyonel yükte özel VRAM'in yerini tutmuyor. TopCPU'nun 'yüzde 93' haberi kapasite esnekliği, hız değil.

Benim çıkarımım şu: gizlilik ve çevrimdışı çalışma önceliğimse ve modelim 16 GB'a sığıyorsa bu kutu masada mantıklı bir istasyona dönüşüyor; bağlam uzunsa, en yüksek kalite gerekiyorsa veya ekip halinde çalışıyorsam bulut API hâlâ daha sağlıklı ve ucuz. Alacaksanız önce modelin sığdığını doğrulayın, ağır kuantizasyonu körlemesine küçümsemeyin ama kendi işinizde sınayın, NGL 99'u silip otomatik bırakın veya 56 gibi elle ayar deneyin ve Nmax 3'te kalın. Ben tek kullanıcılı kod asistanı için bu kurguyu denerim, çok kullanıcılı sunucuda taslağı kapatırım.

Kaynaklar

10 bağlantı; 1 tanesi 2 başka haberde de kullanılıyor. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.

khadas · panther lake · arc b390 · qwen3 · kuantizasyon · llama.cpp · vram

Konuyu takip et

Bu haberden önce

Aynı olayla editör tarafından ilişkilendirilmiş önceki haberlerden kısa bir okuma sırası.

Kanıt ve kaynaklar

İzinli kaynak metnini, sürümünü ve köken bilgisini incele.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…