Une seule échelle va de 32 kilo-octets à 640 gigaoctets, et l'animatrice y pose un vrai appareil sur chaque barreau : un Arduino qui ne loge aucun modèle en bas, huit H100 au niveau des modèles frontières en haut. La question est simple : quelle taille d'IA le matériel de votre poche ou de votre bureau peut-il vraiment faire tourner à la maison ?
Puces : des esprits sur microcontrôleurs
Le premier barreau est la classe des microcontrôleurs , sans système d'exploitation, sans système de fichiers ni barrette mémoire séparée ; tout tient sur la carte. L'Arduino Uno R4 de l'animatrice n'offre que 32 kilo-octets de RAM, et aucun modèle n'y entre. La carte reste utile : en Wi-Fi, elle devient le petit écran d'un modèle tournant sur une grosse machine de la maison, et dans la vidéo un message joyeux venu du Mac Studio s'y affiche.
Un barreau plus haut trône l'ESP32-S3 : 8 mégaoctets de RAM, environ 20 dollars avec écran, deux à cinq dollars sans. Il fait tourner confortablement deux petits modèles d'histoires de la famille TinyStories, à 260 000 et 3 millions de paramètres. Le banc d'essai ESP32 de CircuitDigest, daté de septembre 2026, confirme qu'un modèle de 260 000 paramètres tourne dans cette classe. Ces modèles ne conversent pas et ne produisent ni son ni image ; ils génèrent seulement de courtes histoires cohérentes, sur lesquelles on peut greffer des LED reflétant l'humeur du récit ou un petit jeu de grammaire anglaise.
Mini-ordinateurs : même RAM, vitesse différente
La classe suivante, ce sont de vrais ordinateurs : un Raspberry Pi 5 et l'iPhone 16 de l'animatrice, tous deux avec 8 gigaoctets de RAM. La démo du Pi frappe : trois petits modèles en chaîne, Whisper pour la reconnaissance vocale , Qwen3 1.7B pour le raisonnement et Piper pour vocaliser la réponse, soit une conversation parlée avec la carte. Les projets de type pi-assistant sur GitHub montrent que d'autres ont monté la même chaîne. L'animatrice ajoute une webcam et demande au petit modèle de langage visuel Moondream de décrire la pièce ; il compte correctement la femme en noir, 13 livres éparpillés et le sac à dos.
Mais le Pi a une limite dure : pas de GPU . Même si un petit modèle d'image tient en mémoire, la génération d'images, de musique et de vidéos reste hors de portée car elle réclame de la puissance de calcul. Le Pi compense par capteurs et accessoires ; l'animatrice rappelle que des robots Hugging Face marchent sur cette carte. Petits modèles de langue, mini-modèles visuels et modèles audio : voilà sa zone de confort.
Les mêmes 8 gigaoctets se comportent autrement sur l'iPhone 16, car Apple plafonne chaque application à 4-5 gigaoctets, excluant les modèles moyens de 7 à 14 Go que le Pi accepte. Rien ne s'installe librement non plus ; tout passe par des applications officielles : AI Edge Gallery de Google sur GitHub sert la famille Gemma, tandis que Draw Things fait tourner Stable Diffusion 1.5 de 2 Go sur le téléphone. Les grands modèles Whisper et tous les modèles de synthèse vocale tournent bien, et le modèle de détection YOLO 11N d'Ultralytics compte les objets via l'appareil photo, technologie discrète derrière le déverrouillage facial et la conduite autonome. Selon la documentation d'Ultralytics, YOLO 11 est la série stable actuelle, sortie en septembre 2024.
L'analogie de la cuisine : capacité contre bande passante
L'analogie du restaurant, au milieu de la vidéo, rend le matériel intuitif : congélateur pour le stockage, comptoir pour la RAM , tapis roulant pour le bus mémoire, chef pour le CPU, commis pour le GPU, machines mono-tâche boulonnées au mur pour le NPU. Un modèle est posé sur le comptoir de la mémoire, voyage sur le tapis puis cuit chez les processeurs avant d'être servi en réponse. Le guide de PromptQuorum de septembre 2026 chiffre l'intuition : environ 0,6 Go par milliard de paramètres en quantification 4 bits, soit 4-5 Go pour 7B, environ 9 Go pour 14B et 40 Go pour 70B.
L'analogie résout l'énigme Pi contre iPhone : capacité égale, bande passante inégale. Le Pi n'a qu'un CPU et un bus mémoire étroit et lent, tandis que l'iPhone conjugue CPU, GPU et NPU. La génération d'images, de vidéos et de musique se partage de même : vorace en calcul, elle ne passe pas sur CPU seul. La règle est nette : loger un modèle est un travail de capacité, le faire tourner vite est un travail de bande passante et de processeurs.
Portables et serveurs domestiques : la formule et la boîte 24/7
Dans la classe des portables, le MacBook Pro 32 Go de l'animatrice ouvre presque tout : grands modèles de langue, modèles de code, analyse visuelle, génération d'images et de vidéos, synthèse et reconnaissance vocales, audio et musique. Au quotidien, Qwen3 14B/16B/32B pilotent un agent Hermes, tandis que Qwen3 Coder 30B tourne en local via OpenCode ; le registre d'Ollama liste qwen3-coder 30B à environ 19 Go avec 256 000 jetons de contexte. Flux Dev est le favori pour l'image. L'animatrice partage une formule pratique tirée de sa machine : retrancher 25 % de la RAM annoncée, diviser le reste par 0,6, et le résultat donne le plafond en milliards de paramètres ; pour 32 Go, 24/0,6 = 40B. Cela recoupe exactement le coefficient 0,6 de PromptQuorum.
Un segment appartient au sponsor Crusoe, vanté comme inférence et réglage sans serveur pour essayer les modèles ouverts sans corvée de grappe. Il tient en une phrase de substance et ne change rien à l'échelle.
La classe des serveurs domestiques se justifie deux fois : la boîte reste allumée, et capacité comme bande passante montent. Le Mac Studio 64 Go fait tourner de grands modèles de langue et de code de 27 à 32B avec de gros modèles d'image et de musique, plus une génération vidéo moyenne et lente. L'animatrice y garde ses agents locaux et y relie l'Arduino. L'entrée abordable de la classe, le Mac mini, restant introuvable, elle a pris le Studio. Avec la formule, 64 Go donnent 48 Go utiles et un plafond de 80B à 48/0,6, mais elle reste dans la bande des 30B pour la qualité et la vitesse.
Le Halo AMD annoncé à 128 Go ouvre une porte plus grande avec environ 96 Go utiles : Llama 3.3 70B et GPT-OSS 120B tournent confortablement, avec de très grands modèles de code comme DeepSeek Coder V2. Selon AMD, les machines Strix Halo font tourner jusqu'à 128B paramètres avec LM Studio. L'analyse des prérequis de Llama 3.3 70B par VRLA Tech confirme que cette classe veut plus que la mémoire d'une seule carte. Ce que l'animatrice loue surtout, ce n'est pas un modèle géant unique mais plusieurs modèles chargés à la fois, agent de code, modèle de langue et génération tournant en parallèle. Son point faible est la bande passante : les travaux d'image, de vidéo et de musique finissent lentement.
GPU discrets : les deux mondes à la fois
Le final résout la bande passante avec les GPU discrets . Dans l'analogie, chaque GPU est un paquet apportant ses commis, son comptoir privé et un tapis très large, si bien que chaque carte ajoute processeurs, mémoire dédiée et bande passante ensemble. La RTX 4090 louée en est la démo à 24 Go : génération d'images et de vidéos en un clin d'œil. Selon le guide de packet.ai de juillet 2026, Flux.1 Dev en FP8 veut 18 à 23 Go de mémoire et rend en 9-10 secondes sur 4090 ; 24 Go conviennent donc pile à ce modèle, les plus gros restant exclus. Le Halo AMD et la 4090 se répondent en miroir : haute capacité et basse bande contre basse capacité et haute bande.
Au sommet trônent huit H100 loués : 640 Go de mémoire, énorme capacité et énorme bande passante réunies. Ici s'ouvrent des modèles de langue au-delà de 700B paramètres, du code au-delà de 480B, du traitement visuel et toutes les générations multimodales, avec Minimax produisant vite des vidéos de plusieurs minutes. Verdict de l'animatrice : sauf à être une société de modèles ou à disposer d'un budget sans fin, c'est le bout du chemin, déjà dans la ligue des modèles frontières loués via API. La leçon de l'échelle en une phrase : calculez d'abord la mémoire utile, puis pesez capacité contre bande passante.
Moments clés
Commentaire de l’IA
"L'analogie de la cuisine rend la distinction capacité-bande passante limpide, et la formule au coefficient 0,6 rend chacun capable de calculer son plafond. Malgré le segment sponsorisé et des démos choisies, la logique de l'échelle tient et se vérifie aux sources indépendantes."
Évaluation de l’IA
Le plus fort contre-argument vient du nuage : les barreaux supérieurs se facturent à l'heure ou à la minute, et pour la plupart des lecteurs quelques dollars d'API par mois remplacent des milliers de dollars de matériel. Le local gagne en confidentialité, en usage hors ligne et en coût à long terme, mais louer la qualité frontière ou nourrir un petit modèle à la maison dépend de la fréquence d'usage et du besoin de confidentialité. L'animatrice ne pose jamais ce calcul.
Des manques demeurent : consommation, chaleur et bruit sont tus, et ni le tarif à la minute des 8 H100, ni le taux horaire de la 4090, ni les étiquettes du Halo et du Mac Studio ne sont chiffrés. La distinction VRAM contre mémoire unifiée, le coût qualité des niveaux de quantification et des débits comme les jetons par seconde restent hors démos. Ce qui se montre est choisi ; essais ratés, débogage et temps d'installation restent invisibles.
La position de l'oratrice mérite une note : un segment est soutenu par Crusoe, et elle teste des modèles ouverts pour gagner sa vie, avec des liens de guides vers son écosystème. Cela ne falsifie rien, mais colore les choix : quels modèles sont mis en avant et quel matériel brille passent par ce prisme.
Le conseil pratique commence par la formule : mémoire annoncée moins 25 %, divisée par 0,6, pour trouver son plafond, puis choisir son barreau. Téléphone et Pi pour détection, audio et petites langues ; portable pour code et images ; serveur domestique pour agents 24/7 ; Halo pour 70B et plus ; GPU loués pour génération rapide. Chaque barreau ne jette pas le précédent ; comme l'Arduino le montre, les petites cartes deviennent les petites mains des grosses machines.
Sources
9 liens ; aucun autre article publié ne les cite. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
ia locale · matériel · esp32 · raspberry pi · modèles ouverts · gpu