Apple’ın yeni M5 Ultra ’lı Mac Studio’su masama M3 Ultra’nın yanına geldiğinde ilk sorum netti: 4,3 kata kadar yerel yapay zekâ, 2 kata kadar depolama ve 1,2 TB/s bellek bant genişliği kâğıt üstünde mi kalıyor? Cihazın baz fiyatı 5.499 dolar , bende duran 80 çekirdek GPU, 256 GB birleşik bellek ve 8 TB depolamalı kurulum ise 14.299 dolara çıkıyor; 512 GB seçeneği de gelecek ay geliyor. Apple bu örneği ödünç verdi, M3 Ultra’yı ise kendim aldım, bu yüzden iki makineyi tamamen eşit koşullarda yan yana koşturabildim.
CPU ve Günlük Performans: Ölçülen İlk Farklar
Speedometer tarayıcı testinde M3 Ultra 47 puan alırken M5 Ultra 60,2’ye ulaştı; tek başına M6 ailesinin tek çekirdeği daha hızlı olsa da Studio gövdesinde bu fark hissediliyor. Geliştirici tarafında 100 bin ad alanı ve sınıflı büyük .NET derlemesi M3’te 71,7 saniye sürerken M5’te 52,4 saniyeye indi, Python Mandelbrot benzeri yorumlamalı iş yükü ise 10,25 saniyeden 5,8 saniyeye düştü. Bu sınıfta makine zaten gereğinden güçlü, ancak çok çekirdekli derleme ve betik işlerinde kazanç net ve tekrarlanabilir.
Depolama tarafında Apple’ın iki kat iddiası testte tutumlu bile kaldı. Sıralı kopyalamada M3 Ultra yaklaşık 6,5 GB/s okuma ve 2,7 GB/s yazma verirken M5 Ultra 14,9 GB/s okuma ve 20 GB/s’ye yakın yazma gösterdi; rastgele küçük dosya kopyalamada da oran benzer. 140 GB’lık bir modeli diskten belleğe almak gerektiğinde bu fark doğrudan yükleme süresine yansıyor, her iki test sürücüsü de 8 TB olduğu için karşılaştırma birebir adil.
Bellek Bant Genişliği ve Yapay Zekâ Mimarisindeki Dönüşüm
Bant genişliği kâğıt üstünde M3 Ultra için 819 GB/s, M5 Ultra için 1,2 TB/s olarak listeleniyor. STREAM Triad gibi CPU odaklı ölçümde 312,9 GB/s’ye karşı 583,6 GB/s gördüm; asıl gösterge olan GPU mikro-benchmark ’te ise 724 GB/s’ye karşı 1.039 GB/s ölçüldü, yani M5’te gerçek bant genişliği yaklaşık 1,4 kat . Bu oran tesadüf değil, çünkü yerel modelde token üretimi büyük ölçüde bant genişliğine yaslanıyor.
Mimari değişimin kalbi şu: M3 neslinde GPU çekirdekleri yalnızca grafik çekirdeğiydi, M5 neslinde her GPU çekirdeğinin içinde matris çarpımına özel bir neural accelerator bulunuyor. Bu yüzden aynı derlenen Llama.cpp sürümü M3’te `has_tensor = false` derken M5’te `has_tensor = true` raporladı; yani Metal yolu üzerinde M5 ailesi için ayrılmış özel bir rota tetikleniyor. MLX Apple’ın kendi yığını olarak genelde daha hızlı kalsa da, bu donanım desteği Llama.cpp’nin M5’te belirgin sıçramasını açıklıyor. Testlerin tamamı her iki makinede aynı Llama.cpp ve MLX derlemeleriyle, aynı model dosyalarıyla koşturuldu.
Prompt işleme (PP) ve token üretimi (TG) ayrımı burada kritik. PP, prompt’u okuma aşaması ve daha çok hesaplama/GPU çekirdek hızına dayanıyor; TG ise yanıtı yazma aşaması ve bellek bant genişliğine yaslanıyor. M5 Ultra her ikisini de iyileştiriyor ama özellikle PP tarafında neural accelerator katkısı belirgin, bu yüzden uzun prompt’larda fark açılıyor.
LLM Ölçümleri: Hangi Modelde Ne Kadar Hızlanma Var
DeepSeek V4 Flash 284B gibi büyük bir karışım-uzman (MoE) modelde TG 37’den 53 token/s’ye çıktı, yaklaşık 1,5 kat ; PP ise 483’ten 1.485 token/s’ye, yani 3 kat fırladı. GPT-OSS 120B ’de TG 90’dan 130 token/s’ye, PP 1.300’den 3.200 token/s’ye yükseldi; 64 bin token’lık dolu bağlama ek olarak 32 bin token verildiğinde süre 80 saniyeden 56 saniyeye indi, yine 1,4 kat bandında. Bu tablo MoE modellerde TG’nin bant genişliğini izlediğini, PP’nin ise çekirdek içi hızlandırıcıdan beslendiğini gösteriyor.
Qwen3 27B gibi görece küçük ama yoğun (dense) bir modelde her token tüm ağırlıkları gezdiği için yük daha ağır. Orada TG 37’den 54’e, 1,47 kat ; PP 430’dan 1.800’e, 4 kattan fazla ölçüldü. Birkaç kaynak dosyaya eşdeğer 14 bin token’lık gerçek kod prompt’unda PP 33 saniyeden 8 saniyeye indi, 4,2 kat ; Apple’ın en fazla 4 kat vaadi tam da bu uzun prompt senaryosunda doğrulanıyor. Kısa olanda tablo değişiyor: yaklaşık 350 token’da 1,6 kat , 1.700 token’da 3,4 kat, 4.500 token civarında 4 kat eşiği aşılıyor, yani gündelik sohbet değil, dosya beslemeli ajan kullanımı farkı hissettiriyor.
Güç ve termal tarafta tablo daha dengeli. Üretim sırasında çip raporu M3’te 36W, M5’te 45W gösterdi; tokens per watt yalnızca yaklaşık %12 arttı, boşta tüketim 11–12W’a karşı 8–10W ile M5’te biraz daha düşük. Yoğun GPU yükünde ise M3 ~200W’a çıkarken M5 400W’ı aştı , renk ölçeğinde M5 belirgin biçimde daha sıcak, yaklaşık 43–44 derece ve fan sesi mikrofonuma kadar ulaştı. Verimlilik iyileşmesi var ama mutlak güç ve ısı artışı büyük, bu kasa için yeni bir normal.
İşin mutfağında bir not daha var: Llama.cpp’nin Metal yolu M5’te açılan yeni bir dala bağlanırken MLX’in çekirdek başına optimizasyonu da sürüyor; yani aynı donanımda iki yığının farklı tepe noktaları var ve hangisinin öne geçeceği modele, bağlam uzunluğuna ve nicemlemeye göre değişiyor.
Kapasite planında bugün test edilen her şey 256 GB içine sığdı, ancak 512 GB versiyonun gelişi daha büyük modellerin önünü açıyor. Eşzamanlı 8 istekte toplam üretim M3’te 75 token/s iken M5’te 134 token/s’ye çıktı, bu da servis senaryosunda farkın sürdüğünü gösteriyor. Bir sonraki adımda MLX’e karşı Llama.cpp ve 8-bit varyantların detaylı karşılaştırması geliyor; ilk bakışta M5’in asıl getirisi 1,5 kat TG ve 2–4 kat PP özeti olarak netleşiyor.
Token Üretimi Karşılaştırması (tok/s)
- DeepSeek M337
- DeepSeek M553
- Qwen M337
- Qwen M554
- GPT-OSS M390
- GPT-OSS M5130
| Bulgular | Değer |
|---|---|
| Bant genişliği artışı | GPU’da 1,4× (724→1.039 GB/s) |
| Token üretimi | ~1,5× tüm MoE ve dense modellerde |
| Prompt işleme | Kısa 1,6×, uzun 4,2×; eşik ~4.500 tok |
| Metrik | M3 Ultra | M5 Ultra |
|---|---|---|
| GPU bant genişliği | 724 GB/s | 1.039 GB/s |
| DeepSeek TG | 37 tok/s | 53 tok/s |
| DeepSeek PP | 483 tok/s | 1.485 tok/s |
| Depolama okuma | 6,5 GB/s | 14,9 GB/s |
| Python Mandelbrot | 10,25 sn | 5,8 sn |
Videodaki anahtar anlar
- Giriş — M5 Ultra masada, M3 yanında
- Fiyat ve konfigürasyon: 256 GB, 80 GPU, 8 TB
- CPU testleri: Speedometer ve derleme süreleri
- Depolama: sıralı ve rastgele hızlarda 2 kat üstü
- Bant genişliği: STREAM ve GPU mikro-benchmark
- Mimari: çekirdek içi neural accelerator ve Metal yolu
- LLM: DeepSeek ve GPT-OSS’ta PP ve TG
- Güç ve ısı: 400W tepe, 43 derece ve fan sesi
AI yorumu
"Benim okumam şu: M5 Ultra ham güçte ciddi bir sıçrama, özellikle uzun bağlamla çalışan kod ajanları için. Kısa sohbet için fark daha narin; 14 bin dolarlık konfigürasyonu haklı çıkarmak istiyorsanız büyük bağlam ve ağır modellerle beslemeniz gerekiyor."
AI değerlendirmesi
Güçlü yan: video test protokolünü şeffaf kuruyor — aynı derleme, aynı model, aynı sürücü boyutu ve aynı güç ölçüm noktaları. Bu sayede 1,4 kat bant genişliği → 1,5 kat token üretimi korelasyonu pazarlama değil ölçüm olarak okunuyor, özellikle MoE ve dense ayrımını aynı gün içinde göstermesi değerli.
Sınır: kısa prompt’ta 1,6 kat gibi mütevazı bir PP kazancı, gündelik sohbet kullanıcısının hissetmeyebileceği bir yerde duruyor ve 400W+ tepe güç ile 43–44°C termal bedel ciddi; verimlilik artışı %12’de kalırken donanımın fan ve ısı eşiği yükseliyor, bu da sessiz stüdyo vaadiyle çelişebilir.
Çıkarım: M5 Ultra’nın hikâyesi yalnızca hız değil, çekirdek içi neural accelerator ile Apple’ın yerel çıkarım için Metal yolunu yeniden yazması. Bu, Llama.cpp gibi çapraz platform yığınlarda bile iz bırakıyor ve uzun bağlamlı ajan çağında Apple’ı 512 GB seçeneğiyle büyük model alanına doğru itiyor.
Pratikte ne yapmalı: eğer işiniz büyük bağlamla kod ajanı çalıştırmak, 140 GB modelleri sık yüklemek ve eşzamanlı istekler karşılamak ise farkı cebinize koyarsınız; kısa prompt’lu sohbet ve hafif görevler için M3 Ultra hâlâ yeterli ve daha serin/sessiz, yükseltme kararını prompt uzunluğu ve model boyutu belirlemeli.
Kaynaklar
8 bağlantı; 2 tanesi 4 başka haberde de kullanılıyor. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.
- @youtube.com YouTube — M5 Ultra ve M3 Ultra Karsilastirmasi
- @apple.com https://www.apple.com/newsroom/2026/08/apple-introduces-new-mac-studio-with-m5-max-and-m5-ultra
Aynı kaynağı kullanan: 2026 Mac Mini ve Mac Studio: M5 Pro'dan M5 Ultra'ya Sessiz Hız ve 768 GB Bellek Havuzu · AI Icin Mac Almak: Ihtiyaca Gore Tek Rehber
- @apple.com https://www.apple.com/newsroom/2026/08/apple-introduces-m6-and-m5-ultra-for-a-big-leap-in-performance-and-ai-compute
Aynı kaynağı kullanan: Apple'ın İmkânsız Çiftesi — En Ucuz Mac'te 2 Nanometre, En Pahalıda Dört Parçalı Dev · MacBook Pro M6: 2nm Çip, Tek Nesillik Dizüstü ve Bekleme Sorusu
- @macworld.com https://www.macworld.com/article/3220024/apple-announces-the-m5-ultra-mac-studio-with-up-to-512gb-of-ram.html
- @applemust.com https://www.applemust.com/apple-m5studio/
- @arxiv.org https://arxiv.org/html/2607.19438v1
- @mactech.com https://www.mactech.com/2026/08/25/apple-introduces-new-mac-studio-with-m5-max-and-m5-ultra
- @tomsguide.com https://www.tomsguide.com/computing/cpus/the-usd3-999-m3-ultra-mac-studio-barely-beats-the-usd1-999-m4-max-in-leaked-benchmark
m5 ultra · m3 ultra · mac studio · apple silicon · llm · bellek bant genişliği · depolama