Gündeme dön

3.000 Dolarlık Mini PC'de Dev Modeller: 128 GB Birleşik Bellek Gerçekte Ne Çalıştırıyor?

The Stack, 128 GB birleşik belleğe sahip Bosgame M5 mini masaüstünü (AMD Ryzen AI Max+ 395, Strix Halo) merkeze alıyor: 24 GB’lık ekran kartı tavanını beş kat aşan havuz, büyük modelleri sığdırmayı sağlıyor ama 256 GB/s bant, tek tek kelime üretiminde hızı belirliyor. MoE mimarileri yoğun modellere göre çok daha hızlı akıyor, uzun istemcilerde ise işlemci sınırına takılıyor ve 1.699 dolardan 2.999 dolara çıkan fiyat tabloyu değiştiriyor.

Nodesdaily’e aktarım: (UTC+03:00)
YouTube'da izle — CJz2edJ62HQ
Okuma seçenekleri

Bu tarayıcıda cihazdan sesli okuma kullanılamıyor.

Kavram merceği

Bu görünümde geçen teknik kavramlardan birini seç. Genel tanımı, öğretici örneği ve haberdeki kullanımını birlikte oku.

Bu görünümde sözlüğümüzdeki kavramlardan biri bulunmadı. Sözlük henüz tüm terimleri kapsamıyor.

Bosgame’in M5 adlı mini masaüstü kutusu, alıştığımız ekran kartı mantığını tersine çeviriyor: ayrı bir 24 GB video havuzu yerine, işlemci ve tümleşik grafik birimi 128 GB’lık tek bir havuzu paylaşıyor. AMD’nin Ryzen AI Max+ 395 (Strix Halo) mimarisindeki bu birleşik bellek (unified memory — işlemci ve Grafik aynı fiziksel belleği kullanma) fikri, teoride tek bir modelin 24 GB sınırını beş kattan fazla aşmasını sağlıyor. Video’nun sorusu net: 3.000 dolara bu kadar belleği masa üstüne koymak, yerel yapay zekâ için gerçekten en iyi seçenek mi, yoksa en büyük modeli sığdırmakla en hızlı yanıtı almak aynı şey değil mi?

Birleşik Havuz Nedir ve Neden Yavaş Hissettirir?

Normal bir masaüstünde işlemci kendi belleğinde, ekran kartı ise anakart veriyolunun karşısında kendi özel VRAM’inde oturur. 70 milyar parametreli yoğun bir modeli 24 GB karta yüklemeye kalkarsanız, kart taşar ve fazlalığı anakart belleğine döker; hız bir anda çakılır. M5 bu duvarı kaldırıp havuzu tekleştiriyor — tek bir masa gibi düşünün: dev kitap (model) tamamen tek parça halinde serilebiliyor. Pürüz şu: masa devasa ama üzerinde gezinme hızınız düşük. TechPowerUp havuzun hızını ~256 GB/s ölçüyor; bu, RTX 4090’daki GDDR6X’in ~1.008 GB/s seviyesinin dörtte biri. Her kelime üretilirken modelin tüm sayıları bu masanın üzerinden bir kez süpürülüyor; bant genişliği (bandwidth — saniyede taşınan veri) hızın tavanını doğrudan belirliyor. Linux’ta ise bu havuz öntanımlı gelmiyor; satın alma rehberlerindeki ~110 GB kullanılabilir grafik payına yaklaşmak için çekirdek ayarıyla tahsisi elle büyütmek gerekiyor, aksi halde büyük model kapıdan dönüyor.

Hangi modeller sığıyor ve hangileri gerçekten akıyor sorusunun cevabı mimaride gizli. Yoğun (dense) model — her parametrenin her kelimede uyandığı yapı — 70 milyar parametrede bile sığıyor ama kelime başına 70 milyar sayıyı veri yolundan çekmek zorunda kaldığı için 4-5 token/s bandında sürünüyor. Uzmanlar karışımı (MoE — Mixture of Experts, her kelimede dev kütüphaneden yalnızca birkaç uzmanın uyandığı seyrek mimari) tam tersini yapıyor: 120 milyar parametrelik dev bir yapının içinde kelime başına yalnızca 5-6 milyar parametre çalışıyor. Tıpkı kütüphanede her soruda tüm rafları değil, doğru uzmanlık rafını açmak gibi. Kanalın aynı yonga üzerindeki ölçümleri bunu doğruluyor: Qwen3 ve GPT-OSS 120B yazılım arka ucuna göre 15 ile 56 token/s arasında gidip geliyor; daha küçük 30 milyarlık MoE ise 70 token/s üzerine çıkıyor. Yani en hızlı koşan küçük MoE olduğunda mesaj net: kapasite kadar mimari de kader.

Ne Kadar Bellek Gerekir? 0,6 GB Kuralı ve Çelişen Ölçümler

Model sığar mı hesabını pratiğe dökmek için Model Fit kılavuzu 4-bit sıkıştırmada parametre başına ~0,6 GB kuralını veriyor. Bu kurala göre 80 milyar parametre ~50 GB , 120 milyar ~65 GB istiyor; ikisi de 110 GB tavanının altında rahat kalıyor. Yine de ‘tek bir doğru hız’ yok. Mine Studio aynı yongada GPT-OSS 120B’yi ~30 token/s , 35 milyarlık modeli 50 token/s üzerinde raporlarken, Model Fit aynı büyük model için test edilmemiş 11 token/s tahmini koyuyor. Fark derleyici bayrakları ve çalışma zamanı (llama.cpp, ROCm backend’i) seçiminde. Kanalın kendi tekrarında aynı Qwen modeli optimize edilmemiş derlemede 1,79 token/s iken doğru bayraklarla 15,56 token/s ’ye zıplıyor; yani hız silikondan çok yazılımda saklı. Kural tek: kelime başına uyanan parametre azaldıkça, havuzdan geçen veri de azalıyor ve metin akıyor.

AMD’nin ‘4090’dan 2,2 kat hızlı’ manşeti tam da bu noktada anlam kazanıyor — ama yalnızca bir senaryoda. Llama 3.1 70B gibi 24 GB’a sığmayan yoğun bir modelde, RTX 4090 fazlalığı PCIe veriyolundan (anakartın dar kokteyl pipeti) yudumlamak zorunda kalıyor; M5 ise modelin tamamını daha yavaş ama tek parça havuzunda tutuyor ve aritmetik doğru çıkıyor. CES 2025 sunumundaki kıyas tam buradan kurulmuş. r/LocalLLaMA topluluğu tuzağı hemen gördü: Strix Halo kralı devirmedi, AMD en elverişli zemini seçti. Sığan modellerde ise tablo tersine dönüyor; 24 GB içine giren her işte ayrık kart belirgin biçimde daha hızlı . Özetle takas net: masaüstü kartın üretim hızından vazgeçip, küçük kasada devasa kapasite satın alıyorsun.

İstemciyi Okumak Başka, Yanıtı Yazmak Başka

Metin üretimi iki farklı iş: okuma (prefill — istemciyi bir kerede yutma) ve yazma (decode — kelime kelime üretim) . Yazma bellek bant işi ve M5 bunu fena yapmıyor; büyük MoE sohbet hızında akabiliyor. Okuma ise saf paralel işlem gücü işi. Model ilk kelimeyi yazmadan önce yapıştırdığın tüm dokümantasyonu, kod parçalarını ve bağlamı bir anda sindirmek zorunda. Tümleşik Radeon 8060S , masaüstü kartın yanında burada nefessiz kalıyor. Reddit’te Strix Halo test edenler bu evreyi ‘compute-limited’ (işlem gücü sınırlı) diye tarif ediyor. Kısa soru-cevapta gecikmeyi hissetmiyorsun; fakat yerel kod asistanı her turda yalnızca yazdığın cümleyi değil, proje ağacını, dosyaları, derleyici hatalarını paketleyip yolluyor. Yani değişken adını tüm repoda değiştir demek, yanıt başlamadan önce uzun bir ‘yutma’ evresi demek. Her turda aynı fatura kesiliyor.

Kurulum tarafı ayrı bir proje. Windows kutuyu tak-çalıştır bir cihaz gibi görüp grafik payını temkinli tutuyor; büyük modeli yüklemeden önce tahsisi elle artırmak gerekiyor ve menünün yeri sürücü sürümüne göre değişiyor. İşin ikinci katmanı yazılım: llama.cpp aynı Qwen modelinde bayrak değişimiyle 1,79’dan 15,56 token/s’ye hopluyor. ROCm (AMD’nin GPU yazılım yığını) tarafı ise hızlı hareket eden hedef: aynı geliştirici, 96 GB makinede VLM motorunu dört ROCm sürümü boyunca 9 ay çalıştıramadığını, sonra yeni sürümde ek düzeltme olmadan çalıştığını anlatıyor; başkaları hâlâ kaynaktan derlemek zorunda. Alacağın araç için bugünkü durumu, tarihli bir incelemeye değil, o aracın güncel ROCm/llama.cpp durumuna bakarak değerlendir.

Fiyat Gerçeği: 1.699’tan 2.999’a, Tepe 3.847 ve Lehimli Bellek

Fiyat hikâyesi tek başına ders niteliğinde. Lansmanda 128 GB konfigürasyon 1.699 dolar etiketle girdi; Bosgame mağazası bugün aynı yapıyı 2.999 dolar listeliyor — 1.300 dolar sıçrayış. Guru3D ilk fiyatı yalnızca 128 GB seçenek varken raporlamıştı. 96 GB sürüm birkaç yüz dolar daha ucuz ama asıl mesele bulunurluk: eski düşük fiyatlı listelemelerin tamamı tükenmiş durumda, önemli olan bugün satın alabildiğin konfigürasyonun etiketi. Model Fit takipçisi, bellek kıtlığının tepesinde Temmuz 2026’da benzer bir makinenin 3.847 dolara tırmandığını not ediyor; lansmanda aynı sınıf 2.000 dolara yakındı. Belleğin çoğu olan bir makine, belleğin fiyatıyla oynar. Ve bu bellek lehimli LPDDR5X — karta doğrudan bağlı hızlı arayüz bunu gerektiriyor. Kasayı açıp çubuk takamıyorsun; 3.000 dolarlık yatırım genişlemiyor, bu yüzden alacağın bellek boyutunu en baştan, gerçekten koşmayı planladığın en büyük modele göre seçmek, en ucuz kademeyi zorlamaktan daha rasyonel.

Sonuç, pazarlama gürültüsünü temizleyince berraklaşıyor. Bosgame’in ‘RTX 4070 ile eş oyun performansı’ ve kutu üstündeki dev TOPS sayısı satır aralarında kalmalı; ilki satıcı sunumu, ikincisi NPU (sinirsel işlem birimi) hesabı — bu videodaki tüm ölçümler grafik tarafında yapıldı. Daha kritik nokta: bu AMD silikonu etrafında mini masaüstü üreten her rakip aynı işlemci ve grafik mimarisini kullanıyor; Ryzen AI Max+ 395 adını listede görmek, motorun aynı olduğu anlamına geliyor. Yani M5 silikonu satın almanın bir yolu , bariz seçim değil. Aynı fiyata kasa kalitesi, destek ve garanti politikası sahneyi belirliyor. Ve en önemli ders: kapasite (ne sığar) ile hız (ne kadar hızlı akar) iki ayrı sorudur . M5 nadir bir lüks sunuyor — dev MoE’yi yerel ve sessiz tutmak — ama uzun istemciyi çiğnemesi yavaş; teknik sayfanın birinde cömert olması, diğerinde de iyi olduğu anlamına gelmiyor.

Görsel: nodesdaily AI

Bant Genişliği Karşılaştırması

  • M5 birleşik (256)256 GB/s
  • RTX 4090 (1008)1.008 GB/s
Birleşik havuzun bant dezavantajı — TechPowerUp ve GDDR6X verisi.
ÖzellikM5 Strix HaloRTX 4090
Bellek havuzu128 GB birleşik24 GB VRAM
Bant genişliği~256 GB/s~1.008 GB/s
70B yoğun hız4-5 tok/ssığmazsa düşüş
120B MoE hız15-56 tok/ssığmaz
Fiyat (liste)$2.999 (128GB)~$1.599

Videodaki anahtar anlar

  1. Soru: 3.000 dolarlık mini PC ne çalıştırır?
  2. Duvarı kaldırmak: birleşik bellek ve 128 GB havuz
  3. Masa benzetmesi ve 256 GB/s bant gerçeği
  4. MoE vs yoğun: 5-6B aktif ile 70B’nin 4-5 tok/s’si
  5. 120B MoE 15-56 tok/s, 30B MoE 70+ tok/s
  6. 4090’a karşı 2,2× iddiası ve PCIe pipeti
  7. Prefill vs decode: uzun istemcide işlem sınırı
  8. Kod asistanı her turda repoyu yutuyor
  9. 1,79’tan 15,56’ya: bayraklar hızı belirliyor
  10. 1.699 → 2.999 → 3.847: fiyat ve lehimli LPDDR5X

AI yorumu

"Benim notum: bu makine bir hız canavarı değil, bir sığdırma canavarı. Büyük MoE’yi sessizce masada tutmak istiyorsan cazip; kısa kod düzeltmesi için bile binlerce satırı her turda yutması gereken bir asistandan verim bekliyorsan, kapasiteyi hızla karıştırıyorsun ve hayal kırıklığı baştan yazılmış oluyor."

AI değerlendirmesi

En güçlü hâliyle savunursak bu sınıf mantıklı: büyük MoE’yi yerel ve sessiz koşmak isteyen biri için 128 GB birleşik havuz, 65 GB’ta 120B’yi sığdırıp sohbeti akıtabilen nadir bir pratik çözüm. Mihenk, mimaridir — kelime başına 5-6 milyar aktif parametre bandı, veri yolunu rahatlatarak 15-56 token/s bandını mümkün kılıyor. Bu açıdan M5, gizlilik ve kesintisiz erişim karşılığında bandı takas eden bilinçli bir tercih olarak steelman edilebilir.

Sınırlar ise belirgin: havuz büyük ama yavaş (256 GB/s), yoğun modeller 4-5 token/s’ye çakılıyor; istemci uzunluğu arttığında entegre GPU compute-limited kalıyor ve her tur öncesi yutma evresi belirgin gecikme üretiyor. Kurulum, Windows tahsisi + ROCm/llama.cpp bayraklarına duyarlı, 1,79’dan 15,56’ya sıçrayan ölçüm bunun kanıtı; 9 ay süren VLM serüveni, yazılımın donanımdan daha oynak olduğunu gösteriyor. Ayrıca bariz metodoloji eksiği: tek bir ‘yetkili hız’ yok, her kaynak farklı backend ve bayrakla ölçüyor, karşılaştırmaların genellenebilirliği düşük.

Çıkar katmanında tabloyu abartmamak gerek: ‘2,2× 4090’ yalnızca sığmayan işte doğru; sığan işte ayrık kart önde. Satıcının oyun/TOPS iddiaları NPU sayımına dayanıp bu testlerin kapsamı dışında. Bosgame mağazasında 1.699’tan 2.999’a sıçrayan, kıtlıkta 3.847’ye vuran fiyat da denkleme giriyor; lehimli LPDDR5X genişlemeyi kapatıyor ve fiyatı bellek döngüsüne bağlıyor. Doğrulama için bağımsız tekrar ölçümler (Mine Studio, Model Fit, kanal içi tekrar) parça parça var ama tek kör, kontrollü kıyas değil — bu yüzden her hız cümlesi ‘hangi backend, hangi bayrak, hangi tahsis’ ile okunmalı.

Pratik çıkarım dar: amacın büyük MoE ile yerel sohbetse ve kasayı sessiz istiyorsan, parametresi büyük ama seyrek model + doğru backend + 110 GB tahsis üçlüsüyle bu sınıf iş görür. Kod asistanı gibi uzun bağlam, sık yeniden yutma gerektiren işlerde ise entegre hesap sınırına takılır; her ‘tüm repoyu düzelt’ komutu öncesi beklemeyi göze al. Satın alırken en büyük planladığın modele göre bellek seç, ‘ucuz kademe yeter’ diye kısma; aynı Ryzen AI Max+ 395’i taşıyan rakip kutularla kasa kalitesi, destek ve garanti üzerinden kıyasla ve kapasite-hız ayrımını baştan yap.

Kaynaklar

8 bağlantı; bunları kullanan başka yayımlanmış haber yok. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.

bosgame m5 · strix halo · birleşik bellek · moe · yerel yapay zeka

Konuyu takip et

Bu haberden önce

Aynı olayla editör tarafından ilişkilendirilmiş önceki haberlerden kısa bir okuma sırası.

Kanıt ve kaynaklar

İzinli kaynak metnini, sürümünü ve köken bilgisini incele.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…