Du raisonnement sans facture cloud : Nemotron s'installe à la maison
L'épisode Nemotron Labs de la chaîne NVIDIA Developer s'ouvre sur une affirmation frappante : certains des modèles ouverts les plus capables tournent désormais dans un boîtier de salon. L'animateur place la famille Nemotron 3 au centre et montre comment transformer ces modèles en service vivant sur DGX Spark et DGX Station. Le playbook officiel de Build.nvidia.com promet la même chose : un serveur d'inférence de style production sur un seul DGX Spark, derrière une API compatible OpenAI . Autrement dit, un vrai point d'accès à interroger avec curl et à brancher sur agents et outils IDE.
D'abord, la famille elle-même. Selon la page Nemotron 3 de Research.nvidia.com, la famille annoncée le 15 décembre 2025 compte trois membres : Nano, Super et Ultra. Tous partagent une architecture hybride Mamba-Transformer MoE qui promet un débit bien supérieur aux Transformers classiques, à précision égale ou meilleure. Les traits communs impressionnent aussi : conception d'experts LatentMoE sensible au matériel sur Super et Ultra, couches de prédiction multi-token qui accélèrent la génération longue, entraînement en précision NVFP4 et contexte jusqu'à 1 million de tokens . La post-formation apporte l'apprentissage par renforcement multi-environnements et un contrôle du budget de raisonnement à l'inférence.
Trois frères et sœurs : Nano, Super et Ultra
Le petit Nano se lit comme une leçon d'efficacité. D'après les chiffres de la page Research, le modèle n'active que 3,2 milliards de paramètres (3,6 milliards avec les plongements) pour une taille totale de 31,6 milliards. Il surpasse pourtant des modèles bien plus grands comme GPT-OSS-20B et Qwen3-30B-A3B-Thinking-2507. Sur un seul H200, à 8K tokens d'entrée et 16K de sortie, il atteint 3,3 fois le débit de Qwen3-30B-A3B et 2,2 fois celui de GPT-OSS-20B. Il devance aussi ses rivaux sur RULER en contexte long, et ses poids sont publiés en FP8 et BF16 avec recettes et jeux Nemotron-CC.
Le cadet Super, publié le 10 mars 2026, relève la barre. Selon la page Super de Research, ce MoE de 12 milliards de paramètres actifs pour 120 milliards au total est le premier de la série à combiner LatentMoE, couches MTP et pré-entraînement en NVFP4. Les chiffres sont nets : 2,2 fois le débit de GPT-OSS-120B et 7,5 fois celui de Qwen3.5-122B à 8K d'entrée et 64K de sortie, avec en prime la tête sur RULER à un million de tokens. Points de contrôle NVFP4, FP8 et BF16 plus données d'entraînement ouverts : les résultats quittent le laboratoire et se téléchargent.
Un supercalculateur sur le bureau : Spark et Station
Le matériel vaut la moitié de l'histoire. D'après la page DGX Spark de Nvidia.com, la machine offre 1 pétaFLOP de performance IA en FP4 grâce à la superpuce GB10 Grace Blackwell , et ses 128 Go de mémoire unifiée permettent l'inférence jusqu'à 200 milliards de paramètres et le réglage fin jusqu'à 70 milliards. Le réseau ConnectX relie jusqu'à quatre systèmes Spark pour grimper à 700 milliards de paramètres . Le format compact et sobre vise les charges d'agents toujours actifs.
La grande DGX Station déplace le curseur du bureau vers le centre de données. Selon la page Station de Nvidia.com, elle associe la superpuce GB300 Grace Blackwell Ultra à 748 Go de mémoire cohérente et 20 pétaFLOPS de calcul IA, avec développement, réglage et inférence en local jusqu'à 1 billion de paramètres . Sa carte ConnectX-8 à 800 gigabits par seconde peut relier deux Stations. Elle arrive avec une pile logicielle Ubuntu préconfigurée et bibliothèques CUDA-X, plus télémétrie BMC et Redfish pour la gestion de flotte.
Comment installer tout cela en pratique ? La réponse se trouve dans le dépôt NVIDIA/dgx-spark-playbooks sur GitHub et les recettes détaillées de Build.nvidia.com. Pour Nano, la recette est simple : vLLM sous Docker (image v0.20.0), poids locaux Nemotron-3-Nano Omni et serveur sur le port 8000. Pour Super, deux voies : vLLM avec analyseur de raisonnement ou TensorRT-LLM (1.3.0rc9) avec trtllm-serve et fichier de configuration. Les deux exigent un terminal Linux, l'accès GPU sous Docker et un jeton Hugging Face pour les poids protégés ; la première installation prend des dizaines de minutes, mais le risque reste faible.
Le vrai message de la seconde moitié, ce sont les agents. Selon le billet de juin 2026 sur Developer.nvidia.com, NVIDIA raccourcit le chemin du déballage à l'agent local : avec le logiciel système de juin 2026, les mises à jour radio ne sont plus imposées à l'installation, et le plan open source NemoClaw installe en une commande modèle, harnais d'agent et environnement OpenShell isolé. Les performances progressent avec Qwen3.6, et les équipes à l'étroit sur une machine reçoivent un montage de grappe multi-nœuds guidé. La logique est claire : le contexte sensible reste sur l'appareil, le coût par token tombe à zéro.
En conclusion : la frontière entre louer du cloud et acheter un supercalculateur de bureau s'amincit. Spark convient aux équipes sensibles à la confidentialité, aux développeurs d'agents permanents et aux réglages jusqu'à 70 milliards de paramètres ; Station vise les laboratoires qui flirtent avec le billion. Dans les deux cas, la première facture reste le matériel et l'attente des téléchargements : les modèles sont ouverts, mais électricité, disque et maintenance incombent au propriétaire.
Moments clés
Commentaire de l’IA
"Faire tourner de grands modèles sans facture cloud ni données expédiées hors site devient enfin crédible, et les chiffres plaident en ce sens. Lisez toutefois en gardant le badge NVIDIA à l'esprit : les résultats impressionnent, mais une vérification indépendante s'impose."
Évaluation de l’IA
Le contre-argument le plus fort vient du cloud : un H200 loué à l'heure exécute le même Nano avec plus de souplesse, sans achat, électricité ni maintenance, et la montée en gamme se fait en un clic. Les multiplicateurs de 3,3 et 7,5 fois cités par l'animateur sont en outre des mesures NVIDIA ; les reproductions indépendantes sur charges variées se limitent aux comparaisons choisies des pages Research. Ce que les formats 4 bits comme NVFP4 coûtent en précision varie selon les tâches et appelle la prudence, surtout en contexte long.
Il manque aussi des sujets. L'épisode ignore les réalités de bureau comme la consommation et le bruit des ventilateurs ; le vacarme d'un boîtier d'agent permanent au salon reste un mystère. Aucun prix sur les pages officielles, et les listings des revendeurs fluctuent. Les poids protégés exigeant jeton Hugging Face et conditions de licence sont passés sous silence. Et cet article est lui-même une synthèse web : la parole exacte de l'épisode était inaccessible, le contenu compile recettes et pages produits.
L'intérêt de l'orateur est évident : production NVIDIA Developer dont le but est d'inviter dans l'écosystème, vendre du DGX et faire croître NIM et CUDA. Cela ne falsifie pas les chiffres, mais cadre le récit : matériels rivaux, configurations AMD et Apple, voire piles légères compilées avec llama.cpp restent des figurants. Les données NVIDIA Research sont des rapports d'entreprise, pas des articles relus par les pairs.
Leçon pratique pour le lecteur : si votre équipe bâtit déjà des agents, garde ses données hors cloud et travaille autour de 200 milliards de paramètres, Spark est un candidat sérieux au coût d'essai inférieur au cloud. Mais pour quelques essais mensuels, la location gagne encore. Avant de trancher, mesurez votre propre charge, constatez bruit et consommation sur place, puis ouvrez le portefeuille.
Sources
8 liens ; 1 d’entre eux sont aussi cités par 1 autre article. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
- @youtube.com YouTube — NVIDIA Developer
- @build.nvidia.com Build.nvidia.com — Nemotron on DGX Spark playbook
- @developer.nvidia.com NVIDIA Developer Blog — local AI agents on DGX Spark
- @research.nvidia.com NVIDIA Research — Nemotron 3 family
- @research.nvidia.com NVIDIA Research — Nemotron 3 Super
- @nvidia.com Nvidia.com — DGX Spark
Également cité par : Decisions as Retrieval: CLM-8B, the 13x Faster Architecture
- @nvidia.com Nvidia.com — DGX Station
- @github.com GitHub — dgx-spark-playbooks
nemotron · dgx spark · dgx station · ia locale · modèles ouverts · nemoclaw