Ce qui distingue une usine à IA d'un centre de données traditionnel, c'est que l'installation elle-même devient le produit. Le rapport comme les cinq vidéos répètent la même ligne : si la conception, le réseau électrique, l'alimentation et le refroidissement ne sont pas co-conçus, chaque mégawatt est gaspillé. Le chiffre d'affaires se mesure désormais en tokens par watt, donc tout watt inutilisé est du revenu perdu. NVIDIA DSX intervient pour unifier conception, simulation, déploiement et opérations dans un seul système intelligent.
DSX n'est pas un produit unique mais une plateforme et un plan directeur. Construit autour de la génération Vera Rubin, son design de référence traite chaque couche, de la puce au réseau électrique, comme une seule pile. Grâce à un jumeau numérique Omniverse, l'agencement, l'alimentation et le refroidissement sont simulés avant qu'une seule baie n'arrive et les bugs sont détectés à l'écran. Lorsque le site est mis sous tension, DSX OS prend le relais pour provisionner, surveiller et auto-réparer l'infrastructure, transformant des composants de nombreux fournisseurs en une capacité multi-locataire de confiance.
Au cœur du système se trouve l'idée que l'énergie est la contrainte de production, incarnée par DSX MaxLPS. Beaucoup de sites surdimensionnent pour les pics et laissent jusqu'à 40 % de capacité inexploitée. MaxLPS prétend gérer dynamiquement l'alimentation entre GPU, baies et charges de travail pour offrir jusqu'à 40 % de calcul en plus dans le même budget. Les watts perdus sont récupérés de baie en baie et le lissage intra-baie aplatit les pics de courant. Les options de planification MaxP, MaxQ et MaxLPS produisent différents nombres de GPU par MW fixe, MaxLPS s'appuyant sur la puissance moyenne effectivement utilisée.
Le système nerveux de cette orchestration est DSX Exchange. Il fait le pont entre l'informatique et l'OT en tant que bus d'événements ouvert construit sur NATS, parlant MQTT 3.1.1, persistant avec JetStream et fédérant via des nœuds feuilles. Un cluster HA à trois nœuds, des ACL au niveau des topics avec OAuth2/mTLS/NKey et un déploiement déclaratif Helm/ArgoCD permettent aux signaux du bâtiment de parler la même langue. Des agents comme Phaedrus peuvent alors équilibrer en temps réel les systèmes de refroidissement et électriques.
La flexibilité vis-à-vis du réseau électrique réside dans DSX Flex. Les signaux réseau d'effacement, de réponse à la demande et d'événements tarifaires sont lus en direct et interprétés par des agents Emerald AI qui ralentissent ou diffèrent les charges de travail. La même couche orchestre l'énergie hybride entre réseau, renouvelables sur site et stockage. Au lieu d'être un puits à sens unique, l'usine à IA devient un actif flexible qui soulage le réseau. Les vidéos notent l'arrivée de 100 gigawatts de nouvelle capacité d'usines à IA avant la fin de la décennie ; sans flexibilité, cette échelle mettrait les réseaux à rude épreuve.
La chaîne de validation de conception est trop complexe pour un seul outil. Les actifs SimReady sont gérés dans PTC Windchill PLM, l'ingénierie système basée sur les modèles se fait chez Dassault Systèmes, Jacobs finalise la conception dans son application Omniverse sur mesure. Les thermiques externes sont simulés dans Siemens Star-CCM+, les thermiques internes dans Cadence Reality, l'électrique dans ETAP et le réseau dans DSX Air de NVIDIA. La mise en service virtuelle via Procore compresse ensuite les délais de construction et réduit les surprises sur site.
Un autre levier de la distribution électrique est le 800 VDC. Le courant continu haute tension transporte plus de puissance avec moins de pertes cuivre et facilite la montée en échelle. Combiné à MaxLPS, l'enveloppe électrique fixe du site est utilisée plus efficacement et le besoin de recâbler à chaque génération de GPU diminue. Mentionné brièvement dans le rapport, ce détail compte pour les baies denses de classe Rubin.
La percée en matière de refroidissement est le refroidissement liquide direct-to-chip à 45 °C. Une plaque froide en cuivre repose sur le die ; le liquide de refroidissement entrant à 45 °C absorbe la chaleur à la source et ressort vers 55 °C. Le liquide est une boucle fermée composée de 75 % d'eau et de 25 % de propylène glycol, pompée depuis une unité de distribution de liquide à travers les serveurs puis de retour. Les hybrides précédents ne refroidissaient en liquide que les GPU et les CPU tandis que le restait restait refroidi par air ; la génération Rubin est décrite comme la première conception entièrement refroidie par liquide, sans aucun ventilateur.
La magie des 45 °C, c'est la suppression des groupes frigorifiques. Le refroidissement par air classique repose sur des chillers et des tours de refroidissement qui consomment énergie et eau les jours chauds. Lorsque l'eau d'entrée tolère 45 °C, de nombreux climats peuvent fonctionner sans chiller avec des dry coolers. Le blog de NVIDIA note que dans des climats favorables, cela peut réduire la consommation d'eau de refroidissement du bâtiment d'environ 2,6 millions de gallons par mégawatt et par an avec des systèmes à tours jusqu'à presque zéro. Refroidir avec de l'eau plus chaude qu'un jacuzzi semble contre-intuitif, pourtant le silicium reste dans les limites validées à l'intérieur de la plaque froide.
Le tableau comparatif du rapport rend l'écart concret. Le refroidissement par air se situe à un PUE de 1,5 à 1,8 tandis que le liquide à 45 °C descend vers 1,05. La densité est de 15 à 20 kW par baie en air contre 120 kW et plus en liquide. L'eau et l'impact environnemental divergent également : tours d'évaporation ouvertes contre boucle fermée à pertes quasi nulles. Lus ensemble, ces chiffres montrent que le refroidissement liquide réduit non seulement la facture énergétique, mais aussi les coûts fonciers et hydriques.
L'évolutivité et la culture du test sont les autres différenciateurs matériels de DSX. L'Enterprise Reference Architecture repose sur une unité évolutive à quatre nœuds, construite et validée de bout en bout dans les laboratoires NVIDIA, croissant de manière prévisible de quatre à huit, douze et seize nœuds. Les partenaires OEM Cisco, Dell, HPE, Lenovo et Supermicro font passer leurs offres par un comité de revue de conception. Les clients n'achètent donc pas une nomenclature, mais une architecture éprouvée.
Ces architectures se déclinent en trois saveurs. RTX Pro AI Factory pour l'accélération universelle en entrée de gamme, HGX pour l'IA haute performance au milieu, NVL72 pour l'entraînement à l'échelle du giga et les modèles de pointe au sommet. Toutes reposent sur les NVIDIA Certified Systems et Spectrum-X Ethernet avec NVLink et des topologies réseau évolutives. Une entreprise peut démarrer dans un niveau et s'étendre à un autre tandis que les hypothèses réseau et opérationnelles restent cohérentes, réduisant le risque.
Au-dessus du matériel, l'Enterprise Validated Design complète la pile. Dans le gâteau à cinq couches de Jensen, les trois couches inférieures sont énergie-puce-infrastructure, les couches supérieures sont les modèles et les applications ; les architectures de référence couvrent le bas, les designs validés le haut. Le cycle de vie est présenté comme une roue de données : sélection des données, curation, entraînement et affinage, compétences d'agents, déploiement et observabilité, puis réinjection des traces de production dans le cycle de développement suivant. Chaque compartiment héberge des logiciels testés conjointement par NVIDIA et des fournisseurs indépendants.
L'usine propre de NVIDIA est présentée comme preuve vivante. En interne, environ quarante mille employés génèrent quatre mille milliards de tokens par mois et deux cents millions de requêtes d'inférence par jour avec une disponibilité proche de 99,9 %, la demande interne croissant de 40 % d'un mois à l'autre. ChipNeMo, utilisé quotidiennement par presque tous les cinq mille ingénieurs matériel et en évolution depuis trois ans, se distingue. Côté IT, la déviation des tickets et le libre-service ont pris de l'ampleur sur des bureaux virtuels 24h/24 où les agents fonctionnent de manière autonome ; un système initialement dimensionné pour mille utilisateurs a explosé à vingt-cinq mille requêtes lorsque l'usage des agents a décollé.
L'échelle de l'écosystème montre pourquoi DSX est plus qu'un simple dossier. Foxconn, Schneider Electric, Vertiv, Bechtel et Caterpillar construisent l'infrastructure physique selon la spécification DSX ; PTC, Dassault, Siemens, Cadence et ETAP couvrent la simulation, Procore couvre l'exécution sur le terrain. L'exemple d'IREN, un partenariat multi-couches sur un portefeuille mondial de 5 gigawatts commençant par un contrat cloud de 60 mégawatts à Childress, ancre la stratégie. À cette échelle, chaque mois de retard est présenté comme des milliards de revenus perdus.
Pour l'avenir, deux thèmes dominent. L'un est la planification de capacité hybride cloud plus sur site ; avec des cycles d'approvisionnement de 6 à 9 mois, un tampon cloud est essentiel pour répondre à la demande. L'autre est l'informatique confidentielle pour amener en toute sécurité les modèles de pointe sur site, avec des poids chiffrés et à la protection prouvable tandis que les données de l'entreprise restent dans son périmètre. Ensemble, ils décideront de la tokenomique des industries régulées, préoccupées par la conformité et la mobilité des données.
Commentaire de l’IA
""En lisant le rapport aux côtés de cinq vidéos, mon avis est clair : NVIDIA ne vend plus seulement des puces, elle industrialise le bâtiment lui-même — un mouvement pragmatique mais profondément contraignant.""
Évaluation de l’IA
En défendant au mieux l'argument inverse, la promesse d'efficacité de DSX est indissociable de l'échelle et de l'engagement. Construire selon la spécification DSX rend l'absorption de la prochaine génération NVIDIA nettement moins coûteuse, mais le même bâtiment devient coûteux si l'on veut ensuite des ASIC ou un GPU concurrent. Comme le note FrontierNews, comme les couches bâtiment, alimentation, refroidissement et contrôle sont dimensionnées pour le profil prospectif de NVIDIA, le choix rationnel vous maintient chez le même fournisseur. C'est à la fois une co-conception qui améliore les performances et un verrouillage silencieux.
Sur les limites et la méthodologie, trois lacunes se détachent. Premièrement, des chiffres comme 40 % de capacité supplémentaire et un PUE proche de 1,05 supposent une enveloppe électrique fixe et un climat favorable ; changez le mix de charges, la température ambiante ou les contraintes d'un site existant et le même tableau ne tient plus. Deuxièmement, avec une moyenne sectorielle de 1,55 en 2022 et les meilleurs sites hyperscale déjà à 1,2, le gain incrémental de DSX dépend de votre point de départ. Troisièmement, les bacs entièrement refroidis par liquide apportent des coûts opérationnels — risque de fuite, fenêtres de maintenance et fiabilité des CDU — qui manquent de données de terrain étendues ; une boucle fermée économise l'eau, mais un mélange de glycol et ses unités de distribution exigent leur propre discipline.
Sur la vérifiabilité et les incitations, je nuance le tableau. Les affirmations mesurables — plages de PUE, densité de 120 kW et plus, eau passant de 2,6 millions de gallons par mégawatt et par an vers zéro, tableaux de GPU par MW — sont sourcées ouvertement dans les documents et blogs de NVIDIA, mais toutes mesurées dans la référence DSX simulée sous Omniverse, de classe Rubin. Des contre-vérifications d'études d'Eaton et de l'ASME montrant environ 27 % de baisse de la consommation du bâtiment avec 75 % de transition vers le liquide aident à valider la direction, mais la facture finale varie toujours selon le climat, la tarification et la charge de travail. Sur les incitations, des opérateurs comme IREN choisissent rationnellement DSX pour se prémunir face au futur ; ce choix préconfigure aussi le pouvoir de négociation pour la génération suivante.
Mon avis pratique est le suivant : la co-conception DSX a le plus de sens là où l'inférence est continue, que les budgets de tokens explosent et que les données doivent rester sur site pour des raisons de conformité. Partir de l'unité évolutive à quatre nœuds et progresser vers HGX et NVL72 est convaincant, surtout avec des cas de ROI mesurables comme ChipNeMo et la déviation des tickets. Si les charges sont éparses, le climat chaud et que le site existant ne peut pas accueillir facilement des boucles liquides, démarrer en hybride et ne planifier que les nouveaux pods en refroidissement liquide est plus sain. Je déciderais non pas sur l'étiquette PUE, mais sur les tokens par mégawatt et la facture d'eau.
Sources
11 liens ; aucun autre article publié ne les cite. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
- @youtube https://www.youtube.com/watch?v=cf40vNN5_Js
- @youtube https://www.youtube.com/watch?v=4O1Gl4_xk3w
- @youtube https://www.youtube.com/watch?v=rsBobT9INP4
- @youtube https://www.youtube.com/watch?v=Pkh0dqLCsrs
- @youtube https://www.youtube.com/watch?v=Jpsq_-1kJTo
- @nvidia https://www.nvidia.com/en-us/data-center/products/dsx/
- @docs https://docs.nvidia.com/dsx/maxlps/overview
- @blogs https://blogs.nvidia.com/blog/liquid-cooling-ai-factories/
- @frontiernews https://www.frontiernews.ai/news/article/nvidias-dsx-strategy-locks-data-centers-into-its-e-15be137a
- @eaton https://www.eaton.com/us/en-us/markets/data-centers/data-center-cooling/efficiency/energy-consumption-in-data-centers-air-versus-liquid-cooling.html
- @docs https://docs.nvidia.com/dsx-exchange/architecture
nvidia dsx · usine ia · refroidissement liquide · 45c · maxlps · pue · vera rubin