Retour au fil

M5 Ultra à l’essai : mémoire, stockage et LLM local face au M3 Ultra

Avec M3 Ultra et nouveau M5 Ultra côte à côte, j’ai vérifié les promesses d’Apple — jusqu’à 4,3× en IA, stockage doublé et 1,2 To/s — sur les mêmes modèles et piles logicielles ; les mesures confirment le marketing, mais le ressenti varie avec la longueur du prompt.

Importé dans Nodesdaily : (UTC+03:00)
Voir sur YouTube — c_58D7ixOQI
Options de lecture

La lecture vocale n’est pas disponible dans ce navigateur.

Loupe à concepts

Choisissez un terme technique de cette vue pour lire sa définition générale, un exemple pédagogique et son usage dans l’article.

Aucun terme de notre glossaire n’a été trouvé dans cette vue. Le glossaire ne couvre pas encore tous les termes.

Quand le nouveau Mac Studio M5 Ultra a rejoint mon M3 Ultra sur le bureau, la question était simple : les promesses d’Apple — jusqu’à 4,3× en IA locale, stockage doublé et 1,2 To/s — tiennent-elles hors des slides ? Le ticket d’entrée est à 5 499 $ , la config de test 80 cœurs GPU, 256 Go mémoire unifiée et 8 To stockage monte à 14 299 $, une option 512 Go arrive le mois prochain. Prêt Apple pour le M5, M3 acheté, donc tests à piles Llama.cpp et MLX identiques et mêmes fichiers modèles.

CPU et usage quotidien : premiers écarts mesurés

Sur Speedometer , le M3 Ultra affiche 47 contre 60,2 pour le M5 ; le cœur M6 isolé est plus véloce, mais le châssis Studio montre déjà le saut générationnel. Côté dev, une grosse compilation .NET à 100k namespaces et classes passe de 71,7 s à 52,4 s, un workload Python type Mandelbrot de 10,25 s à 5,8 s, soit près de 1,9× . La machine reste surdimensionnée pour du code pur, mais les gains multicœurs et interprétés sont nets.

Le stockage dépasse même le discours marketing. En copie séquentielle, environ 6,5 Go/s en lecture et 2,7 Go/s en écriture sur M3 contre 14,9 Go/s et près de 20 Go/s sur M5 ; l’aléatoire petits fichiers reste aussi au-delà de 2×. Quand il faut charger un modèle de 140 Go depuis le disque , cet écart raccourcit directement l’attente, avec deux SSD de 8 To pour une comparaison équitable.

Bande passante et nouvelle architecture IA

Sur le papier Apple annonce 819 Go/s pour M3 et 1,2 To/s pour M5. Avec STREAM Triad , test CPU, je mesure 312,9 Go/s vs 583,6 Go/s ; le micro-benchmark GPU , utile pour l’IA, donne 724 Go/s vs 1 039 Go/s , soit 1,4× réel sur M5. Ce ratio colle à la hausse observée en génération de tokens, très sensible à la bande passante.

Le changement clé : les cœurs GPU M3 étaient classiques, chaque cœur M5 intègre désormais un accélérateur neuronal dédié au multiply matriciel . Voilà pourquoi le même binaire Llama.cpp signale `has_tensor = false` sur M3 et `has_tensor = true` sur M5, ouvrant une voie Metal optimisée pour la famille M5 . MLX , la pile maison d’Apple, reste souvent la plus rapide, mais ce crochet matériel explique le bond en traitement du prompt sous Llama.cpp. Builds et poids identiques des deux côtés.

La distinction traitement du prompt (PP) vs génération de tokens (TG) est centrale. PP — lire votre prompt — tire sur le calcul et la vitesse des cœurs GPU , TG — écrire la réponse — tire sur la bande passante . Le M5 améliore les deux, mais PP profite surtout de l’accélérateur par cœur, d’où l’écart qui s’ouvre sur les longs prompts.

Mesures LLM : gains par modèle

Sur le grand MoE DeepSeek V4 Flash 284B , TG passe de 37 à 53 tok/s, environ 1,5× , PP de 483 à 1 485 tok/s, soit 3× . Sur GPT-OSS 120B , TG de 90 à 130 tok/s et PP d’environ 1 300 à 3 200 tok/s ; avec 32k tokens ajoutés à 64k déjà en contexte , on passe de 80 s à 56 s, encore 1,4× . La règle se confirme : TG suit la bande passante, PP suit les accélérateurs.

Sur un Qwen3 27B dense , plus petit mais où chaque token parcourt tous les poids, la charge est plus lourde. TG de 37 à 54 tok/s, 1,47× , PP de 430 à 1 800 tok/s, plus de 4× . Un prompt code réaliste de 14k tokens chute de 33 s à 8 s, 4,2× , validant le jusqu’à 4× d’Apple pile sur les longs contextes. La courbe dépend de la longueur : 1,6× à ~350 tokens , 3,4× vers 1 700, seuil 4× autour de 4 500 , donc chat bref modeste, agent nourri aux fichiers nettement gagnant.

Côté énergie et thermique, le ton est plus nuancé. En génération, puce à 36W sur M3 vs 45W sur M5 , tokens par watt +12 % seulement ; au repos ~11–12W vs 8–10W, un peu mieux sur M5. En charge GPU soutenue, M3 culmine près de 200W , M5 dépasse 400W , plus chaud autour de 43–44°C et clairement plus audible. L’efficacité progresse, la puissance absolue et la chaleur aussi.

Un dernier mot du banc : la voie Metal de Llama.cpp bifurque désormais pour la famille M5 tandis que l’optimisation par cœur de MLX continue, donc le même silicium a deux pics différents et le leader change selon modèle, contexte et quantification.

En capacité, tout tenait dans 256 Go aujourd’hui, mais l’option 512 Go à venir ouvrira des modèles encore plus grands et des déploiements plus rapides. À huit requêtes simultanées , le débit agrégé passe de 75 à 134 tok/s, le gain persiste en concurrence. Prochaine étape : MLX vs Llama.cpp et 8-bit en détail ; le bilan provisoire est net — ~1,5× en TG et 2–4× en PP selon la longueur , agents de code en premiers bénéficiaires.

Visualization: nodesdaily AI

Génération de tokens comparée (tok/s)

  • DeepSeek M337
  • DeepSeek M553
  • Qwen M337
  • Qwen M554
  • GPT-OSS M390
  • GPT-OSS M5130
Génération sur modèles identiques ; plus haut est mieux.
ConstatValeur
Hausse bande1,4× sur GPU (724→1 039 Go/s)
Génération~1,5× sur MoE et dense
Traitement prompt1,6× court, 4,2× long ; seuil ~4 500
MétriqueM3 UltraM5 Ultra
Bande GPU724 Go/s1 039 Go/s
DeepSeek TG37 tok/s53 tok/s
DeepSeek PP483 tok/s1 485 tok/s
Lecture stockage6,5 Go/s14,9 Go/s
Python Mandelbrot10,25 s5,8 s

Moments clés

  1. Intro — M5 Ultra à côté du M3
  2. Prix et config : 256 Go, 80 GPU, 8 To
  3. CPU : Speedometer et temps de build
  4. Stockage : séquentiel et aléatoire au-delà de 2×
  5. Bande passante : STREAM et micro-bench GPU
  6. Architecture : accélérateur par cœur et voie Metal
  7. LLM : PP et TG sur DeepSeek et GPT-OSS
  8. Énergie et chaleur : pic 400W, 43°C et bruit

Commentaire de l’IA

"Mon avis : le M5 Ultra marque un vrai bond brut, surtout pour les agents de code sur long contexte. En chat court, le gain est plus fin ; pour justifier une config à 14 k$, il faut de gros contextes et des modèles lourds."

Évaluation de l’IA

Point fort : protocole transparent — mêmes builds, mêmes modèles, même taille de disque et mêmes sondes de puissance. La corrélation 1,4× de bande passante → 1,5× en génération se lit alors comme mesure, pas comme marketing, et le double test MoE vs dense le même jour a une vraie valeur.

Limites : 1,6× en PP sur prompts courts , à peine perceptible en chat quotidien, et pic à 400W+ avec 43–44°C : coût thermique non négligeable ; l’efficacité ne prend que ~12 % tandis que bruit et chaleur montent, en tension avec la promesse d’un studio silencieux.

Enjeu : le M5 Ultra n’est pas qu’un gain de vitesse, c’est Apple qui réécrit la voie Metal pour l’inférence locale avec un accélérateur neuronal par cœur . Cela marque même des piles cross-platform comme Llama.cpp et, avec l’option 512 Go, pousse Apple vers les très grands modèles pour agents à long contexte.

En pratique : si vous faites tourner des agents de code sur gros contextes, chargez souvent 140 Go et servez en concurrence , le gain est tangible ; pour chat court et tâches légères, le M3 reste ample et plus frais/silencieux — laissez longueur de prompt et taille de modèle décider.

Sources

8 liens ; 2 d’entre eux sont aussi cités par 4 autres articles. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

m5 ultra · m3 ultra · mac studio · apple silicon · llm · bande passante · stockage

Suivre le sujet

Avant cet article

Un court ordre de lecture des articles antérieurs reliés à cet événement par un éditeur.

Preuves et sources

Consultez les passages autorisés, leurs versions et leur origine.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…