Quand le nouveau Mac Studio M5 Ultra a rejoint mon M3 Ultra sur le bureau, la question était simple : les promesses d’Apple — jusqu’à 4,3× en IA locale, stockage doublé et 1,2 To/s — tiennent-elles hors des slides ? Le ticket d’entrée est à 5 499 $ , la config de test 80 cœurs GPU, 256 Go mémoire unifiée et 8 To stockage monte à 14 299 $, une option 512 Go arrive le mois prochain. Prêt Apple pour le M5, M3 acheté, donc tests à piles Llama.cpp et MLX identiques et mêmes fichiers modèles.
CPU et usage quotidien : premiers écarts mesurés
Sur Speedometer , le M3 Ultra affiche 47 contre 60,2 pour le M5 ; le cœur M6 isolé est plus véloce, mais le châssis Studio montre déjà le saut générationnel. Côté dev, une grosse compilation .NET à 100k namespaces et classes passe de 71,7 s à 52,4 s, un workload Python type Mandelbrot de 10,25 s à 5,8 s, soit près de 1,9× . La machine reste surdimensionnée pour du code pur, mais les gains multicœurs et interprétés sont nets.
Le stockage dépasse même le discours marketing. En copie séquentielle, environ 6,5 Go/s en lecture et 2,7 Go/s en écriture sur M3 contre 14,9 Go/s et près de 20 Go/s sur M5 ; l’aléatoire petits fichiers reste aussi au-delà de 2×. Quand il faut charger un modèle de 140 Go depuis le disque , cet écart raccourcit directement l’attente, avec deux SSD de 8 To pour une comparaison équitable.
Bande passante et nouvelle architecture IA
Sur le papier Apple annonce 819 Go/s pour M3 et 1,2 To/s pour M5. Avec STREAM Triad , test CPU, je mesure 312,9 Go/s vs 583,6 Go/s ; le micro-benchmark GPU , utile pour l’IA, donne 724 Go/s vs 1 039 Go/s , soit 1,4× réel sur M5. Ce ratio colle à la hausse observée en génération de tokens, très sensible à la bande passante.
Le changement clé : les cœurs GPU M3 étaient classiques, chaque cœur M5 intègre désormais un accélérateur neuronal dédié au multiply matriciel . Voilà pourquoi le même binaire Llama.cpp signale `has_tensor = false` sur M3 et `has_tensor = true` sur M5, ouvrant une voie Metal optimisée pour la famille M5 . MLX , la pile maison d’Apple, reste souvent la plus rapide, mais ce crochet matériel explique le bond en traitement du prompt sous Llama.cpp. Builds et poids identiques des deux côtés.
La distinction traitement du prompt (PP) vs génération de tokens (TG) est centrale. PP — lire votre prompt — tire sur le calcul et la vitesse des cœurs GPU , TG — écrire la réponse — tire sur la bande passante . Le M5 améliore les deux, mais PP profite surtout de l’accélérateur par cœur, d’où l’écart qui s’ouvre sur les longs prompts.
Mesures LLM : gains par modèle
Sur le grand MoE DeepSeek V4 Flash 284B , TG passe de 37 à 53 tok/s, environ 1,5× , PP de 483 à 1 485 tok/s, soit 3× . Sur GPT-OSS 120B , TG de 90 à 130 tok/s et PP d’environ 1 300 à 3 200 tok/s ; avec 32k tokens ajoutés à 64k déjà en contexte , on passe de 80 s à 56 s, encore 1,4× . La règle se confirme : TG suit la bande passante, PP suit les accélérateurs.
Sur un Qwen3 27B dense , plus petit mais où chaque token parcourt tous les poids, la charge est plus lourde. TG de 37 à 54 tok/s, 1,47× , PP de 430 à 1 800 tok/s, plus de 4× . Un prompt code réaliste de 14k tokens chute de 33 s à 8 s, 4,2× , validant le jusqu’à 4× d’Apple pile sur les longs contextes. La courbe dépend de la longueur : 1,6× à ~350 tokens , 3,4× vers 1 700, seuil 4× autour de 4 500 , donc chat bref modeste, agent nourri aux fichiers nettement gagnant.
Côté énergie et thermique, le ton est plus nuancé. En génération, puce à 36W sur M3 vs 45W sur M5 , tokens par watt +12 % seulement ; au repos ~11–12W vs 8–10W, un peu mieux sur M5. En charge GPU soutenue, M3 culmine près de 200W , M5 dépasse 400W , plus chaud autour de 43–44°C et clairement plus audible. L’efficacité progresse, la puissance absolue et la chaleur aussi.
Un dernier mot du banc : la voie Metal de Llama.cpp bifurque désormais pour la famille M5 tandis que l’optimisation par cœur de MLX continue, donc le même silicium a deux pics différents et le leader change selon modèle, contexte et quantification.
En capacité, tout tenait dans 256 Go aujourd’hui, mais l’option 512 Go à venir ouvrira des modèles encore plus grands et des déploiements plus rapides. À huit requêtes simultanées , le débit agrégé passe de 75 à 134 tok/s, le gain persiste en concurrence. Prochaine étape : MLX vs Llama.cpp et 8-bit en détail ; le bilan provisoire est net — ~1,5× en TG et 2–4× en PP selon la longueur , agents de code en premiers bénéficiaires.
Génération de tokens comparée (tok/s)
- DeepSeek M337
- DeepSeek M553
- Qwen M337
- Qwen M554
- GPT-OSS M390
- GPT-OSS M5130
| Constat | Valeur |
|---|---|
| Hausse bande | 1,4× sur GPU (724→1 039 Go/s) |
| Génération | ~1,5× sur MoE et dense |
| Traitement prompt | 1,6× court, 4,2× long ; seuil ~4 500 |
| Métrique | M3 Ultra | M5 Ultra |
|---|---|---|
| Bande GPU | 724 Go/s | 1 039 Go/s |
| DeepSeek TG | 37 tok/s | 53 tok/s |
| DeepSeek PP | 483 tok/s | 1 485 tok/s |
| Lecture stockage | 6,5 Go/s | 14,9 Go/s |
| Python Mandelbrot | 10,25 s | 5,8 s |
Moments clés
- Intro — M5 Ultra à côté du M3
- Prix et config : 256 Go, 80 GPU, 8 To
- CPU : Speedometer et temps de build
- Stockage : séquentiel et aléatoire au-delà de 2×
- Bande passante : STREAM et micro-bench GPU
- Architecture : accélérateur par cœur et voie Metal
- LLM : PP et TG sur DeepSeek et GPT-OSS
- Énergie et chaleur : pic 400W, 43°C et bruit
Commentaire de l’IA
"Mon avis : le M5 Ultra marque un vrai bond brut, surtout pour les agents de code sur long contexte. En chat court, le gain est plus fin ; pour justifier une config à 14 k$, il faut de gros contextes et des modèles lourds."
Évaluation de l’IA
Point fort : protocole transparent — mêmes builds, mêmes modèles, même taille de disque et mêmes sondes de puissance. La corrélation 1,4× de bande passante → 1,5× en génération se lit alors comme mesure, pas comme marketing, et le double test MoE vs dense le même jour a une vraie valeur.
Limites : 1,6× en PP sur prompts courts , à peine perceptible en chat quotidien, et pic à 400W+ avec 43–44°C : coût thermique non négligeable ; l’efficacité ne prend que ~12 % tandis que bruit et chaleur montent, en tension avec la promesse d’un studio silencieux.
Enjeu : le M5 Ultra n’est pas qu’un gain de vitesse, c’est Apple qui réécrit la voie Metal pour l’inférence locale avec un accélérateur neuronal par cœur . Cela marque même des piles cross-platform comme Llama.cpp et, avec l’option 512 Go, pousse Apple vers les très grands modèles pour agents à long contexte.
En pratique : si vous faites tourner des agents de code sur gros contextes, chargez souvent 140 Go et servez en concurrence , le gain est tangible ; pour chat court et tâches légères, le M3 reste ample et plus frais/silencieux — laissez longueur de prompt et taille de modèle décider.
Sources
8 liens ; 2 d’entre eux sont aussi cités par 4 autres articles. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
- @youtube.com YouTube — Comparatif M5 Ultra vs M3 Ultra
- @apple.com https://www.apple.com/newsroom/2026/08/apple-introduces-new-mac-studio-with-m5-max-and-m5-ultra
Également cité par : 2026 Mac Mini and Mac Studio: From M5 Pro to M5 Ultra — Silent Speed and a 768 GB Memory Pool · Buying a Mac for AI: The Only Guide You Need
- @apple.com https://www.apple.com/newsroom/2026/08/apple-introduces-m6-and-m5-ultra-for-a-big-leap-in-performance-and-ai-compute
Également cité par : Apple's Impossible Double — 2-Nanometer in the Cheapest Mac, a Quad-Die Monster in the Priciest · MacBook Pro M6: 2nm Chip, a One-Chip Generation, and the Waiting Question
- @macworld.com https://www.macworld.com/article/3220024/apple-announces-the-m5-ultra-mac-studio-with-up-to-512gb-of-ram.html
- @applemust.com https://www.applemust.com/apple-m5studio/
- @arxiv.org https://arxiv.org/html/2607.19438v1
- @mactech.com https://www.mactech.com/2026/08/25/apple-introduces-new-mac-studio-with-m5-max-and-m5-ultra
- @tomsguide.com https://www.tomsguide.com/computing/cpus/the-usd3-999-m3-ultra-mac-studio-barely-beats-the-usd1-999-m4-max-in-leaked-benchmark
m5 ultra · m3 ultra · mac studio · apple silicon · llm · bande passante · stockage