Le créateur explique qu'il utilise un MacBook Pro M5 Max avec 128 Go de mémoire unifiée comme machine principale depuis cinq mois. Selon lui, c'est actuellement la configuration la plus élevée disponible au format MacBook Pro, portant toute sa charge de travail sur une seule machine. La vidéo pose une question pointue : jusqu'où ce matériel peut-il être poussé pour l'IA locale, et où se heurte-t-il à ses limites.
La pile d'IA locale n'est pas une application unique : LM Studio, des runners basés sur MLX, Ollama et llama.cpp cohabitent côte à côte. Côté modèles, il a essayé différentes tailles issues des familles Qwen, Gemma et GLM. Grâce à la mémoire unifiée, les gros fichiers de poids sont partagés entre CPU et GPU sans copie, ce qui rend l'ensemble du dispositif pratique.
Les agents de code changent la donne : les assistants locaux répondent si vite que l'expérience donne parfois l'impression d'être connecté à un modèle cloud. L'édition à grand contexte et la navigation dans tout le projet tournent sans accroc sur la machine. Pour lui, cette fluidité quotidienne est plus convaincante que les chiffres bruts des benchmarks.
Chaleur et bruit varient selon la taille des modèles : avec des modèles à petits paramètres, la machine reste froide et silencieuse, les ventilateurs tournant à peine. Les grands modèles inversent la tendance, surtout les nouvelles versions de classe Flash, où les ventilateurs tournent en permanence et où la chaleur dégagée est évidente. Le silence n'est pas garanti ; cela dépend de la charge de travail.
Le segment sur le fine-tuning est l'une des surprises de la vidéo : il utilise le framework MLX d'Unsloth pour affiner de grands modèles de langage sur ses propres données, et qualifie le résultat de étonnamment fluide sur ce portable. Il a également préparé un cours sur le fine-tuning avec des modèles locaux pour ceux qui veulent aller plus loin. Entraîner sur un portable relevait de la fantaisie il y a quelques années ; ici, c'est présenté comme une routine.
Parmi les modèles qu'il cite figurent un modèle dense de 27 milliards de paramètres de la famille Qwen, un modèle mixture-of-experts Flash Next, et la version 5.3 Flash de GLM. Il admet franchement que la latence varie selon la longueur du contexte, le type de requête et l'utilisation des cœurs. Son verdict global reste néanmoins positif : les attentes varient, mais les tâches aboutissent et la machine ne l'a jamais laissé en plan.
Comparé côte à côte à son ancien M1 Max, il constate des écarts allant jusqu'à 8x, qu'il attribue aux blocs d'accélération IA intégrés au GPU. Le gain se manifeste non seulement dans les réponses du chat, mais aussi dans la génération d'images et l'entraînement de transformers. La vidéo elle-même a été montée et rendue sur cette machine ; les grands projets avec de nombreux éléments et les exports rapides dans Final Cut Pro et Camtasia sont mis en avant.
La bande passante mémoire est annoncée à 614 Go/s et présentée comme la raison pour laquelle cette machine se démarque. Face à son M4 mini, l'écart est décrit comme étant de plusieurs multiples, et le mini nouvellement annoncé ne s'en approche pas non plus. Le bond de bande passante du M1 Max au M5 Max montre à quel point l'écart s'est creusé.
L'histoire des prix est la partie la plus concrète : il a acheté la machine en avril pour environ 11 599 dollars néo-zélandais. La flambée ultérieure des prix de la mémoire a fait grimper la même configuration d'environ 5 000 NZD, soit une hausse de 30 à 40 pour cent. Acheter tôt lui a donné un sérieux avantage ; la même décision au tarif actuel serait bien plus difficile.
Dans la démo en direct, un modèle mixture-of-experts de 26 milliards de paramètres de la famille Gemma 4 tourne avec une quantification 4 bits et un module de spéculation accéléré activé. Le modèle se charge entièrement en mémoire au premier lancement, le Moniteur d'activité affiche environ 46 Go utilisés, et la pression mémoire reste au vert. La vitesse de génération se mesure à environ 108 tokens par seconde en questions-réponses, atteignant 150 sur des requêtes légères.
Il évoque aussi des expériences antérieures : des résultats avec le modèle de 27 milliards de paramètres de Qwen, une génération rapide d'images SVG, et une migration complète de .NET 8 vers .NET 10, mises à jour de bibliothèques comprises, terminée en quelques minutes. Le module de spéculation raccourcit visiblement ces tâches en plusieurs étapes. Un assistant de code local fonctionnant à cette vitesse constitue la démo la plus convaincante de la vidéo.
Côté positif : la portabilité, une utilisation quotidienne silencieuse, une inférence fluide dans la classe des 27-32 milliards de paramètres, et le fine-tuning sur le portable ; la machine semble pérenne pour cette classe. Côté négatif se trouve le plafond : les grands modèles actuels peuvent déjà approcher 121-122 Go de mémoire virtuelle, et avec le système d'exploitation plus la surcharge de quantification, la limite de 128 Go est à portée de main. Si un futur modèle exige 192 ou 256 Go tout en promettant des performances locales de classe Claude, cette machine ne suffira pas.
Il conclut en notant que les Mac restaient autrefois sur les bureaux pendant dix ans, tandis que la faim de mémoire pourrait dater cette machine d'ici quelques années. Les projets d'Apple d'exécuter ses propres modèles d'IA sur ces machines font partie de l'équation. Cela dit, il est satisfait de son achat, et suggère à quiconque attend un M6 ou un M6 Ultra de trancher dans ce contexte avant de remercier les spectateurs et de clore la vidéo.
Commentaire de l’IA
""Ce que je trouve honnête dans cette vidéo, c'est la façon dont elle mêle éloge et mise en garde : 128 Go représentent le point idéal aujourd'hui, mais à ce rythme d'appétit des modèles, cela pourrait devenir le plafond.""
Évaluation de l’IA
Pour défendre l'argument inverse : les partisans des API cloud disent que le temps prime sur le matériel, et payer quelques dollars de frais d'API plutôt que de se battre avec un modèle local bloqué est rationnel pour la plupart des équipes. Des guides indépendants le confirment, notant qu'un portable à 4 000 dollars perd encore certaines tâches face à un PC de bureau avec GPU à 2 000 dollars. J'estime que cette objection réduit la portée de la vidéo sans la réfuter : pour apprendre, bricoler et garder les données sur l'appareil, la configuration locale est une option réelle.
Il y a des lacunes méthodologiques : il s'agit d'un retour d'expérience sur une seule machine, un seul utilisateur, sans contrôle. Les 108-150 tokens par seconde affichés à l'écran proviennent d'un petit modèle mixture-of-experts, tandis que les classements indépendants situent les modèles denses de 70 milliards de paramètres sur cette classe de matériel à 15-18 tokens par seconde. L'affirmation sur le fine-tuning n'est étayée par aucun chronométrage ni courbe de perte, et les observations de chaleur restent au niveau de la sensation plutôt que du thermomètre.
L'angle intérêt et vérifiabilité compte aussi : le présentateur a acheté la machine avec son propre argent et fait la promotion d'un cours payant sur le sujet, ce qui ajoute un optimisme naturel à toute affirmation de satisfaction. Heureusement, les chiffres clés recoupent des sources indépendantes : la bande passante de 614 Go/s et la flambée des prix de la mémoire sont confirmées par les déclarations d'Apple elle-même. Cela dit, je revérifierais les vitesses de tokens et les prix par rapport aux annonces actuelles au moment de décider, car les deux évoluent chaque mois.
Mon enseignement pratique : pour quiconque veut une seule machine portable qui fait tourner la classe des 27-32 milliards de paramètres sans accroc au quotidien, cette configuration est un excellent choix. Ceux qui prévoient de faire tourner en production des modèles denses de 70B et plus, ceux que la flambée des prix de la mémoire exclut, ou ceux qui restent à un bureau trouveront plus sensibles les options de bureau 128 Go ou l'attente du M6. Pour quiconque veut que ses données restent sur l'appareil, cette vidéo offre une véritable feuille de route.
Sources
5 liens ; aucun autre article publié ne les cite. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
- @youtube https://www.youtube.com/watch?v=jzqBtld_iIg
- @promptquorum https://www.promptquorum.com/local-llms/apple-silicon-m5-local-llm
- @localaimaster https://localaimaster.com/blog/apple-m5-for-ai-guide
- @9to5mac https://9to5mac.com/2026/06/17/apple-confirms-price-increases-are-coming-to-its-products-due-to-ram-shortage
- @kingy https://kingy.ai/blog/mac-studio-m5-local-ai-buying-guide
m5 max · ia locale · 128 go