Bosgame’in M5 adlı mini masaüstü kutusu, alıştığımız ekran kartı mantığını tersine çeviriyor: ayrı bir 24 GB video havuzu yerine, işlemci ve tümleşik grafik birimi 128 GB’lık tek bir havuzu paylaşıyor. AMD’nin Ryzen AI Max+ 395 (Strix Halo) mimarisindeki bu birleşik bellek (unified memory — işlemci ve Grafik aynı fiziksel belleği kullanma) fikri, teoride tek bir modelin 24 GB sınırını beş kattan fazla aşmasını sağlıyor. Video’nun sorusu net: 3.000 dolara bu kadar belleği masa üstüne koymak, yerel yapay zekâ için gerçekten en iyi seçenek mi, yoksa en büyük modeli sığdırmakla en hızlı yanıtı almak aynı şey değil mi?
Birleşik Havuz Nedir ve Neden Yavaş Hissettirir?
Normal bir masaüstünde işlemci kendi belleğinde, ekran kartı ise anakart veriyolunun karşısında kendi özel VRAM’inde oturur. 70 milyar parametreli yoğun bir modeli 24 GB karta yüklemeye kalkarsanız, kart taşar ve fazlalığı anakart belleğine döker; hız bir anda çakılır. M5 bu duvarı kaldırıp havuzu tekleştiriyor — tek bir masa gibi düşünün: dev kitap (model) tamamen tek parça halinde serilebiliyor. Pürüz şu: masa devasa ama üzerinde gezinme hızınız düşük. TechPowerUp havuzun hızını ~256 GB/s ölçüyor; bu, RTX 4090’daki GDDR6X’in ~1.008 GB/s seviyesinin dörtte biri. Her kelime üretilirken modelin tüm sayıları bu masanın üzerinden bir kez süpürülüyor; bant genişliği (bandwidth — saniyede taşınan veri) hızın tavanını doğrudan belirliyor. Linux’ta ise bu havuz öntanımlı gelmiyor; satın alma rehberlerindeki ~110 GB kullanılabilir grafik payına yaklaşmak için çekirdek ayarıyla tahsisi elle büyütmek gerekiyor, aksi halde büyük model kapıdan dönüyor.
Hangi modeller sığıyor ve hangileri gerçekten akıyor sorusunun cevabı mimaride gizli. Yoğun (dense) model — her parametrenin her kelimede uyandığı yapı — 70 milyar parametrede bile sığıyor ama kelime başına 70 milyar sayıyı veri yolundan çekmek zorunda kaldığı için 4-5 token/s bandında sürünüyor. Uzmanlar karışımı (MoE — Mixture of Experts, her kelimede dev kütüphaneden yalnızca birkaç uzmanın uyandığı seyrek mimari) tam tersini yapıyor: 120 milyar parametrelik dev bir yapının içinde kelime başına yalnızca 5-6 milyar parametre çalışıyor. Tıpkı kütüphanede her soruda tüm rafları değil, doğru uzmanlık rafını açmak gibi. Kanalın aynı yonga üzerindeki ölçümleri bunu doğruluyor: Qwen3 ve GPT-OSS 120B yazılım arka ucuna göre 15 ile 56 token/s arasında gidip geliyor; daha küçük 30 milyarlık MoE ise 70 token/s üzerine çıkıyor. Yani en hızlı koşan küçük MoE olduğunda mesaj net: kapasite kadar mimari de kader.
Ne Kadar Bellek Gerekir? 0,6 GB Kuralı ve Çelişen Ölçümler
Model sığar mı hesabını pratiğe dökmek için Model Fit kılavuzu 4-bit sıkıştırmada parametre başına ~0,6 GB kuralını veriyor. Bu kurala göre 80 milyar parametre ~50 GB , 120 milyar ~65 GB istiyor; ikisi de 110 GB tavanının altında rahat kalıyor. Yine de ‘tek bir doğru hız’ yok. Mine Studio aynı yongada GPT-OSS 120B’yi ~30 token/s , 35 milyarlık modeli 50 token/s üzerinde raporlarken, Model Fit aynı büyük model için test edilmemiş 11 token/s tahmini koyuyor. Fark derleyici bayrakları ve çalışma zamanı (llama.cpp, ROCm backend’i) seçiminde. Kanalın kendi tekrarında aynı Qwen modeli optimize edilmemiş derlemede 1,79 token/s iken doğru bayraklarla 15,56 token/s ’ye zıplıyor; yani hız silikondan çok yazılımda saklı. Kural tek: kelime başına uyanan parametre azaldıkça, havuzdan geçen veri de azalıyor ve metin akıyor.
AMD’nin ‘4090’dan 2,2 kat hızlı’ manşeti tam da bu noktada anlam kazanıyor — ama yalnızca bir senaryoda. Llama 3.1 70B gibi 24 GB’a sığmayan yoğun bir modelde, RTX 4090 fazlalığı PCIe veriyolundan (anakartın dar kokteyl pipeti) yudumlamak zorunda kalıyor; M5 ise modelin tamamını daha yavaş ama tek parça havuzunda tutuyor ve aritmetik doğru çıkıyor. CES 2025 sunumundaki kıyas tam buradan kurulmuş. r/LocalLLaMA topluluğu tuzağı hemen gördü: Strix Halo kralı devirmedi, AMD en elverişli zemini seçti. Sığan modellerde ise tablo tersine dönüyor; 24 GB içine giren her işte ayrık kart belirgin biçimde daha hızlı . Özetle takas net: masaüstü kartın üretim hızından vazgeçip, küçük kasada devasa kapasite satın alıyorsun.
İstemciyi Okumak Başka, Yanıtı Yazmak Başka
Metin üretimi iki farklı iş: okuma (prefill — istemciyi bir kerede yutma) ve yazma (decode — kelime kelime üretim) . Yazma bellek bant işi ve M5 bunu fena yapmıyor; büyük MoE sohbet hızında akabiliyor. Okuma ise saf paralel işlem gücü işi. Model ilk kelimeyi yazmadan önce yapıştırdığın tüm dokümantasyonu, kod parçalarını ve bağlamı bir anda sindirmek zorunda. Tümleşik Radeon 8060S , masaüstü kartın yanında burada nefessiz kalıyor. Reddit’te Strix Halo test edenler bu evreyi ‘compute-limited’ (işlem gücü sınırlı) diye tarif ediyor. Kısa soru-cevapta gecikmeyi hissetmiyorsun; fakat yerel kod asistanı her turda yalnızca yazdığın cümleyi değil, proje ağacını, dosyaları, derleyici hatalarını paketleyip yolluyor. Yani değişken adını tüm repoda değiştir demek, yanıt başlamadan önce uzun bir ‘yutma’ evresi demek. Her turda aynı fatura kesiliyor.
Kurulum tarafı ayrı bir proje. Windows kutuyu tak-çalıştır bir cihaz gibi görüp grafik payını temkinli tutuyor; büyük modeli yüklemeden önce tahsisi elle artırmak gerekiyor ve menünün yeri sürücü sürümüne göre değişiyor. İşin ikinci katmanı yazılım: llama.cpp aynı Qwen modelinde bayrak değişimiyle 1,79’dan 15,56 token/s’ye hopluyor. ROCm (AMD’nin GPU yazılım yığını) tarafı ise hızlı hareket eden hedef: aynı geliştirici, 96 GB makinede VLM motorunu dört ROCm sürümü boyunca 9 ay çalıştıramadığını, sonra yeni sürümde ek düzeltme olmadan çalıştığını anlatıyor; başkaları hâlâ kaynaktan derlemek zorunda. Alacağın araç için bugünkü durumu, tarihli bir incelemeye değil, o aracın güncel ROCm/llama.cpp durumuna bakarak değerlendir.
Fiyat Gerçeği: 1.699’tan 2.999’a, Tepe 3.847 ve Lehimli Bellek
Fiyat hikâyesi tek başına ders niteliğinde. Lansmanda 128 GB konfigürasyon 1.699 dolar etiketle girdi; Bosgame mağazası bugün aynı yapıyı 2.999 dolar listeliyor — 1.300 dolar sıçrayış. Guru3D ilk fiyatı yalnızca 128 GB seçenek varken raporlamıştı. 96 GB sürüm birkaç yüz dolar daha ucuz ama asıl mesele bulunurluk: eski düşük fiyatlı listelemelerin tamamı tükenmiş durumda, önemli olan bugün satın alabildiğin konfigürasyonun etiketi. Model Fit takipçisi, bellek kıtlığının tepesinde Temmuz 2026’da benzer bir makinenin 3.847 dolara tırmandığını not ediyor; lansmanda aynı sınıf 2.000 dolara yakındı. Belleğin çoğu olan bir makine, belleğin fiyatıyla oynar. Ve bu bellek lehimli LPDDR5X — karta doğrudan bağlı hızlı arayüz bunu gerektiriyor. Kasayı açıp çubuk takamıyorsun; 3.000 dolarlık yatırım genişlemiyor, bu yüzden alacağın bellek boyutunu en baştan, gerçekten koşmayı planladığın en büyük modele göre seçmek, en ucuz kademeyi zorlamaktan daha rasyonel.
Sonuç, pazarlama gürültüsünü temizleyince berraklaşıyor. Bosgame’in ‘RTX 4070 ile eş oyun performansı’ ve kutu üstündeki dev TOPS sayısı satır aralarında kalmalı; ilki satıcı sunumu, ikincisi NPU (sinirsel işlem birimi) hesabı — bu videodaki tüm ölçümler grafik tarafında yapıldı. Daha kritik nokta: bu AMD silikonu etrafında mini masaüstü üreten her rakip aynı işlemci ve grafik mimarisini kullanıyor; Ryzen AI Max+ 395 adını listede görmek, motorun aynı olduğu anlamına geliyor. Yani M5 silikonu satın almanın bir yolu , bariz seçim değil. Aynı fiyata kasa kalitesi, destek ve garanti politikası sahneyi belirliyor. Ve en önemli ders: kapasite (ne sığar) ile hız (ne kadar hızlı akar) iki ayrı sorudur . M5 nadir bir lüks sunuyor — dev MoE’yi yerel ve sessiz tutmak — ama uzun istemciyi çiğnemesi yavaş; teknik sayfanın birinde cömert olması, diğerinde de iyi olduğu anlamına gelmiyor.
Bant Genişliği Karşılaştırması
- M5 birleşik (256)256 GB/s
- RTX 4090 (1008)1.008 GB/s
| Özellik | M5 Strix Halo | RTX 4090 |
|---|---|---|
| Bellek havuzu | 128 GB birleşik | 24 GB VRAM |
| Bant genişliği | ~256 GB/s | ~1.008 GB/s |
| 70B yoğun hız | 4-5 tok/s | sığmazsa düşüş |
| 120B MoE hız | 15-56 tok/s | sığmaz |
| Fiyat (liste) | $2.999 (128GB) | ~$1.599 |
Videodaki anahtar anlar
- Soru: 3.000 dolarlık mini PC ne çalıştırır?
- Duvarı kaldırmak: birleşik bellek ve 128 GB havuz
- Masa benzetmesi ve 256 GB/s bant gerçeği
- MoE vs yoğun: 5-6B aktif ile 70B’nin 4-5 tok/s’si
- 120B MoE 15-56 tok/s, 30B MoE 70+ tok/s
- 4090’a karşı 2,2× iddiası ve PCIe pipeti
- Prefill vs decode: uzun istemcide işlem sınırı
- Kod asistanı her turda repoyu yutuyor
- 1,79’tan 15,56’ya: bayraklar hızı belirliyor
- 1.699 → 2.999 → 3.847: fiyat ve lehimli LPDDR5X
AI yorumu
"Benim notum: bu makine bir hız canavarı değil, bir sığdırma canavarı. Büyük MoE’yi sessizce masada tutmak istiyorsan cazip; kısa kod düzeltmesi için bile binlerce satırı her turda yutması gereken bir asistandan verim bekliyorsan, kapasiteyi hızla karıştırıyorsun ve hayal kırıklığı baştan yazılmış oluyor."
AI değerlendirmesi
En güçlü hâliyle savunursak bu sınıf mantıklı: büyük MoE’yi yerel ve sessiz koşmak isteyen biri için 128 GB birleşik havuz, 65 GB’ta 120B’yi sığdırıp sohbeti akıtabilen nadir bir pratik çözüm. Mihenk, mimaridir — kelime başına 5-6 milyar aktif parametre bandı, veri yolunu rahatlatarak 15-56 token/s bandını mümkün kılıyor. Bu açıdan M5, gizlilik ve kesintisiz erişim karşılığında bandı takas eden bilinçli bir tercih olarak steelman edilebilir.
Sınırlar ise belirgin: havuz büyük ama yavaş (256 GB/s), yoğun modeller 4-5 token/s’ye çakılıyor; istemci uzunluğu arttığında entegre GPU compute-limited kalıyor ve her tur öncesi yutma evresi belirgin gecikme üretiyor. Kurulum, Windows tahsisi + ROCm/llama.cpp bayraklarına duyarlı, 1,79’dan 15,56’ya sıçrayan ölçüm bunun kanıtı; 9 ay süren VLM serüveni, yazılımın donanımdan daha oynak olduğunu gösteriyor. Ayrıca bariz metodoloji eksiği: tek bir ‘yetkili hız’ yok, her kaynak farklı backend ve bayrakla ölçüyor, karşılaştırmaların genellenebilirliği düşük.
Çıkar katmanında tabloyu abartmamak gerek: ‘2,2× 4090’ yalnızca sığmayan işte doğru; sığan işte ayrık kart önde. Satıcının oyun/TOPS iddiaları NPU sayımına dayanıp bu testlerin kapsamı dışında. Bosgame mağazasında 1.699’tan 2.999’a sıçrayan, kıtlıkta 3.847’ye vuran fiyat da denkleme giriyor; lehimli LPDDR5X genişlemeyi kapatıyor ve fiyatı bellek döngüsüne bağlıyor. Doğrulama için bağımsız tekrar ölçümler (Mine Studio, Model Fit, kanal içi tekrar) parça parça var ama tek kör, kontrollü kıyas değil — bu yüzden her hız cümlesi ‘hangi backend, hangi bayrak, hangi tahsis’ ile okunmalı.
Pratik çıkarım dar: amacın büyük MoE ile yerel sohbetse ve kasayı sessiz istiyorsan, parametresi büyük ama seyrek model + doğru backend + 110 GB tahsis üçlüsüyle bu sınıf iş görür. Kod asistanı gibi uzun bağlam, sık yeniden yutma gerektiren işlerde ise entegre hesap sınırına takılır; her ‘tüm repoyu düzelt’ komutu öncesi beklemeyi göze al. Satın alırken en büyük planladığın modele göre bellek seç, ‘ucuz kademe yeter’ diye kısma; aynı Ryzen AI Max+ 395’i taşıyan rakip kutularla kasa kalitesi, destek ve garanti üzerinden kıyasla ve kapasite-hız ayrımını baştan yap.
Kaynaklar
8 bağlantı; bunları kullanan başka yayımlanmış haber yok. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.
- @youtube.com YouTube — The Stack: 3.000 Dolarlık Mini PC Gerçekte Ne Çalıştırır
- @amd.com https://www.amd.com/en/developer/resources/technical-articles/2025/amd-ryzen-ai-max-395--a-leap-forward-in-generative-ai-performanc.html
- @amd.com https://www.amd.com/en/products/processors/desktops/ryzen/ryzen-ai-halo/ryzen-ai-max-plus-395.html
- @notebookcheck.net https://www.notebookcheck.net/AMD-Strix-Halo-lineup-led-by-Ryzen-AI-Max-395-zealously-aims-to-overtake-Apple-M4-Pro-Core-Ultra-9-288V-2x-faster-than-RTX-4090-in-AI-with-87-less-power.941958.0.html
- @hothardware.com https://hothardware.com/news/amd-strix-halo-rtx-4070-mem-bw
- @github.com https://github.com/botAGI/strix-halo-llm-benchmarks
- @amd.com https://rocm.docs.amd.com/projects/ai-ecosystem/en/latest/inference/llamacpp.html
- @bosgamepc.com https://www.bosgamepc.com/en
bosgame m5 · strix halo · birleşik bellek · moe · yerel yapay zeka