La question d'ouverture est directe : avec l'annonce des nouveaux Mac mini et Mac Studio, faut-il acheter une machine neuve ou garder celle que vous avez ? La réponse dépend de quatre variables : ce que vous voulez que le modèle fasse, à quelle vitesse vous le voulez, la mémoire dont vous disposez et votre budget. Toute l'analyse passe par un outil de comparaison gratuit que le créateur a construit : choisissez un Mac et voyez quels modèles tiennent, ou choisissez un modèle et voyez quel Mac il lui faut. Si la vidéo dépasse cent mille vues, l'outil passera en open source.
Il commence par des catégories de capacités plutôt que par des tableaux de benchmarks bruts, en demandant ce que chaque modèle peut réellement faire pour vous. La première catégorie va de 38 à 48 Go : Qwen 3.8 27B, le modèle du quotidien. Résumer un PDF de cinquante pages, rédiger ou expliquer un contrat, écrire des scripts, avancer dans une base de code tâche par tâche, tout cela se situe ici. Il le compare à Opus 4.6, un modèle de pointe vieux de six mois. La limite est claire : laissez-le une heure sur un gros travail de code ou posez-lui des questions de recherche de niveau expert, et il décroche par rapport au cloud.
La deuxième catégorie tourne autour de 128 Go : Qwen 3.8 Flash et ses pairs. Cela débloque le travail de bureau multi-étapes avec outils : recherche sur plusieurs sites, remplissage d'un tableur à partir d'une pile de documents, codage multi-fichiers plus solide avec des tests exécutés en autonomie. C'est un ajustement serré sur une machine de 128 Go et il peine si d'autres applications sont ouvertes. Il le place juste en dessous de Claude Opus 4.8, près de GPT 5.6 Terra. Il est visiblement plus rapide et plus capable que la catégorie précédente.
La troisième catégorie exige au moins 256 Go : GLM 5.3 Flash. C'est le modèle qui a circulé anonymement et gratuitement sur OpenRouter sous le nom d'Ox Alpha avant que Z.ai ne confirme qu'il s'agissait d'une version GLM. Il le qualifie de niveau ingénieur : codage au niveau projet, boucles de test et correction, sessions plus longues, entrée multimodale native. La taille totale est importante, mais l'architecture mixture-of-experts lit peu de données par token, ce qui apporte vitesse et faible coût par token. DeepSeek V4 Flash est une alternative dans cette gamme, mais il le juge moins capable.
La quatrième catégorie est de 512 Go, le plafond actuel d'une seule machine : GLM 5.2 et 5.3 complets. Avec seulement environ 54 milliards de paramètres actifs, la structure MoE atteint une capacité proche des modèles phares : travail d'expert, meilleur codage, sessions autonomes plus longues. Le point de référence est GPT 5.6 Soul, avec une réserve : les sessions longues apportent plus d'hallucinations et de perte de cohérence que les modèles phares du cloud. C'est néanmoins un niveau frappant pour un modèle exécuté localement.
La cinquième catégorie dépasse un seul Mac : chaîner deux, quatre machines ou plus pour exécuter des modèles géants de manière distribuée. L'exemple est Kimi K3, qui nécessite environ 1,5 To de mémoire en Q4, autrement dit environ quatre machines de classe Studio haut de gamme. Le résultat se situe entre Opus 4.8 et Fable 5, le point local le plus proche de la frontière actuelle. Il le présente comme un exemple de plafond pour ceux qui ont le budget et l'infrastructure, pas pour tout le monde. Le message est explicite : tout le monde veut le plus gros, mais tout le monde n'en a pas besoin.
Ces catégories sont recoupées avec l'Artificial Analysis Intelligence Index : Kimi K3 près de 50 contre Fable 5 à 53, la famille GLM dans la fourchette de GPT 5.6 Soul, Qwen 3.8 27B en dessous d'Opus 4.8, GLM Flash au-dessus d'Opus 4.8. Le point le plus frappant est la tendance temporelle : à taille égale, les modèles deviennent rapidement plus intelligents, et le saut de Qwen 3.6 à 3.8 le prouve. Ainsi, une tâche nécessitant 256 Go aujourd'hui pourrait être résolue dans la gamme des 48 Go dans six à douze mois. Acheter gros règle le présent mais n'assure pas l'avenir.
La physique de la vitesse est le cœur de la vidéo. Chaque token lit le modèle entier depuis la mémoire : Qwen 3.8 27B en Q4 représente environ 17 Go par token et jusqu'à quarante tokens par seconde selon la machine ; le fichier Q8 fait 29 Go, donc les lectures par token montent à 31 Go et la vitesse chute. Le fichier GLM Flash approche 200 Go en Q4 mais ne lit qu'environ 30 Go par token grâce au MoE, il reste donc rapide malgré sa taille. La quantification (Q4/Q8) réduit les fichiers, facilite l'ajustement et échange une petite perte de qualité contre de la vitesse.
Le plafond, c'est la bande passante mémoire : Mac mini M6 près de 170 Go/s, MacBook Pro M5 Pro 307 Go/s, M5 Max 460 à 614 Go/s, M5 Ultra 1,2 To/s. L'exemple détaillé est Qwen 3.8 27B Q4 à 32k de contexte : environ 6,5 tokens par seconde sur le M6, ce qui paraît très lent, 13 sur le M5 Pro, 22 sur le M5 Max, environ 40 sur le M5 Ultra. La fenêtre de contexte est la variable cachée : le cache représente une fraction de gigaoctet à 8k mais 17 Go à 256k, ce qui divise la vitesse à peu près par deux. Or le vrai travail d'agent exige 128k et plus ; les comparaisons à petites fenêtres paraissent rapides mais induisent en erreur.
Les surcoûts du processeur, le runtime et l'accélération complètent le tableau. Il existe une taxe fixe par token d'environ 4 ms sur la génération M4 et de 0,5 ms sur le M5 ; elle compte à peine pour les gros modèles mais domine les petits modèles rapides. Sur du matériel identique, MLX tourne jusqu'à quarante pour cent plus vite que GGUF basé sur llama.cpp pour les modèles MoE, avec un écart plus faible sur les modèles denses. La prédiction multi-tokens fait passer l'exemple Qwen de 22 tokens par seconde à la fourchette 34 à 56, et les méthodes spéculatives avec modèle de brouillon vont plus loin. À l'inverse, la RAM excédentaire au-delà de l'ajustement, les cœurs CPU ou le nombre de cœurs GPU seuls n'augmentent pas la vitesse de décodage ; la bande passante fixe le plafond et les gigaoctets supplémentaires restent inutilisés.
Les cartes d'ajustement et de vitesse de l'outil suivent. Qwen 3.8 27B Q4 à 32k de contexte tient sur tous les Mac listés ; Flash tourne sur une machine de 64 Go via pagination SSD avec une forte pénalité de qualité ; le seuil confortable pour GLM Flash est un M5 Ultra de 256 Go, avec le M3 Ultra 256 Go plus lent comme alternative. À 256k de contexte, la situation se durcit : la plupart des machines en dessous de 128 Go doivent faire des compromis, tandis que 128k de contexte tient confortablement sur une machine de 64 Go. Côté vitesse, le Mac mini M5 Pro de 48 Go démarre à 16 tokens par seconde en base et atteint 58 accéléré ; un M1 Max 32 Go le fait encore tourner mais chauffe ; le M5 Ultra de 512 Go projette 50 en base et jusqu'à 180 accéléré sur Qwen. Sur une machine de travail, il faut soustraire les applications ouvertes et le plafond mémoire par défaut de macOS de 67 à 75 pour cent ; MLX réserve plus que GGUF sur les longs prompts.
La comparaison avec le cloud aiguise l'équation économique : un M5 Ultra de 256 Go à près de dix mille dollars équivaut à quatre ans d'un forfait mensuel de deux cents dollars. Mais la plupart des travaux tiennent dans des forfaits de vingt à cent dollars, les limites et restrictions du cloud ne cessent de croître, certaines sorties de modèles phares saturent vite, et les modèles futurs peuvent arriver tardivement chez les consommateurs. De plus, le meilleur modèle est rarement nécessaire. Les coûts locaux sont un fardeau de configuration : pas de mémoire et de connecteurs prêts à l'emploi comme les applications cloud, vous câblez vous-même le harnais, y compris une configuration d'agent comme Hermes ; le calcul suppose une conversation active, quatre conversations parallèles signifient quatre fois la mémoire ; la vie privée est un plus mais la sécurité est votre responsabilité, avec le risque d'injection de prompt et un alignement plus faible ; les scores d'hallucination restent derrière les modèles phares du cloud, avec la gamme Qwen en négatif et GLM Flash à un chiffre positif. D'où une machine par catégorie : Mac mini M5 Pro 48 Go pour le Qwen de base, 128 Go pour Flash, Studio M5 Ultra 256 Go pour GLM Flash, octobre 512 Go pour le GLM complet à environ quinze à dix-huit mille dollars estimés. La vitesse confortable se situe entre 12 et 30 tokens par seconde, en dessous de 15 c'est lent, au-dessus de 30 c'est rapide.
L'outil lui-même est gratuit et sans inscription : une liste Apple Silicon depuis le M1, une option Nvidia DGX Spark, la saisie d'une machine personnalisée, l'édition du modèle, de la quantification et du contexte, l'hypothèse de machine de travail et le choix GGUF contre MLX, un filtre par budget. La matrice d'ajustement montre quel modèle tient sur quelle machine avec quel compromis, le tableau de vitesse affiche les débits par machine et par modèle, la vue modèle d'abord cartographie un modèle sur tous les Mac, la calculatrice de mémoire additionne les modèles sélectionnés. Chaque cellule est cliquable : contexte maximal, quantification maximale, part mémoire, vitesse attendue et sources Hugging Face s'ouvrent ; la formule de vitesse se trouve sur une page séparée avec signalement des chiffres erronés, export PNG et liens de réglages partageables. Le créateur promet l'open source à cent mille vues pour que la communauté puisse étendre les données machines et modèles et corriger les formules.
Commentaire de l’IA
""Ce qui m'a frappé, c'est la façon dont cette vidéo inverse la question : ce n'est pas combien de RAM vous achetez, mais quel modèle vous exécutez avec quelle fenêtre de contexte. Choisissez d'abord la tâche, ensuite la machine ; l'inverse devient vite coûteux.""
Sources
7 liens ; 1 d’entre eux sont aussi cités par 2 autres articles. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
- @youtube https://www.youtube.com/watch?v=C9Q1ArLSisw
- @apple https://www.apple.com/newsroom/2026/08/apple-introduces-new-mac-studio-with-m5-max-and-m5-ultra
Également cité par : M5 Ultra Tested: Memory, Storage and Local LLM Speed vs M3 Ultra · 2026 Mac Mini and Mac Studio: From M5 Pro to M5 Ultra — Silent Speed and a 768 GB Memory Pool
- @modelfit https://modelfit.io/mac-studio/m5
- @explainx https://explainx.ai/blog/qwen-3-8-27b-open-weight-model-claude-opus-comparison-august-2026
- @openrouter https://openrouter.ai/z-ai/glm-5.3-flash
- @cellcog https://cellcog.ai/blog/glm-5-3-flash
- @muhammadraza https://muhammadraza.me/2026/gguf-vs-mlx-decision-guide
matériel · acheter · pour · seul · guide · dont · nodesdaily