Retour au fil

IA gourmande en énergie : le pari UnifiedBus pour déplacer moins et calculer plus

Face à une demande électrique qui pourrait atteindre 945 TWh en 2030, le vrai défi de l'IA se déplace vers les interconnexions. Le reportage explore la réponse de Huawei avec UnifiedBus et LinkBlade.

Importé dans Nodesdaily : (UTC+03:00)
Voir sur YouTube — qJvE_RbxPjo
Options de lecture

La lecture vocale n’est pas disponible dans ce navigateur.

Loupe à concepts

Choisissez un terme technique de cette vue pour lire sa définition générale, un exemple pédagogique et son usage dans l’article.

Aucun terme de notre glossaire n’a été trouvé dans cette vue. Le glossaire ne couvre pas encore tous les termes.

La facture électrique de l'intelligence artificielle donne le vertige : dans le scénario de base, la demande des centres de données approcherait 945 TWh en 2030 , soit environ 3 % de la consommation mondiale, avec une croissance annuelle proche de 15 %. Le plus surprenant, c'est que près de 80 % de l'énergie d'un calcul partirait dans le déplacement des données, pas dans l'opération elle-même. Autrement dit, les puces passent plus de temps à attendre et à transporter qu'à réfléchir, et c'est ce gaspillage silencieux qui fait exploser les coûts.

Pendant ce temps, les modèles deviennent gigantesques : de 5 000 milliards de paramètres, la trajectoire pointe vers 10 000 à 40 000 milliards , répartis sur des dizaines de milliers d'accélérateurs. Or une puce reste limitée par son réticule de gravure , cette taille maximale imposée par la lithographie, et par la mémoire vive embarquée qui tient à proximité immédiate. On ne peut donc plus loger un modèle entier sur une seule puce, et chaque fragment doit dialoguer en permanence avec les autres, ce qui multiplie les échanges.

Pour expliquer l'impasse, le récit remonte aux origines avec le protocole TCP/IP , ce langage commun qui a permis à des machines hétérogènes de communiquer sur Internet. Les grappes d'IA ont d'abord suivi la même logique : des réseaux généralistes, flexibles et bon marché, mais peu optimisés pour le trafic synchrone et massif de l'entraînement. Quand des milliers de puces doivent s'échanger des gradients au même instant, les files d'attente, les retransmissions et la latence transforment cette souplesse historique en handicap mesurable.

Du protocole réseau au mur du calcul

Nvidia a répondu avec NVLink , une interconnexion propriétaire très rapide : la sixième génération atteindrait 3,6 To/s par GPU, tandis que le lien C2C du NVL72 plafonnerait vers 1,8 To/s, soit environ sept fois PCIe Gen6. Le passage de Hopper à Blackwell aurait même multiplié par 50 les tokens par watt. Mais cette performance a un prix : un écosystème fermé et brutalement coûteux, que le récit appelle la falaise du calcul , ce moment où ajouter des puces ne rapporte presque plus rien parce que le réseau sature.

C'est ici qu'entre en scène l'architecture UnifiedBus de Huawei, portée par le module LinkBlade . Précision utile : le nom Pirium entendu dans la discussion correspond officiellement à UnifiedBus. L'idée consiste à unifier les trafics internes dans une seule trame rapide et à retirer quelque 196 kilomètres de câbles de cuivre dans un SuperPod de 4 096 NPU. Moins de câbles signifie moins de connecteurs, moins de pannes et moins d'énergie perdue, avec un réseau plus simple à opérer à grande échelle.

Le second levier est la mémoire distante , qui permet à une puce d'emprunter directement la mémoire d'un équipement voisin. L'accès prendrait environ 100 nanosecondes , soit à peu près 500 fois plus qu'un registre local, mais infiniment moins qu'un aller-retour vers un stockage lent. Pour des modèles immenses, ce compromis change tout : au lieu de dupliquer des téraoctets partout, les accélérateurs partagent un espace commun, ce qui réduit les copies, lisse les pics et maintient le calcul alimenté en continu.

Mémoire, cuivre et lumière : le pari UnifiedBus

Reste le goulot du maître , ce fameux point central qui distribue le travail et attend que tout le monde ait fini avant de continuer. Dans l'inférence moderne, le cache KV aggrave le phénomène : chaque token généré conserve ses clés et valeurs, et cette mémoire conversationnelle doit suivre la requête sur tout le système. Si le coordinateur centralise trop de décisions, les accélérateurs restent inactifs pendant que les données voyagent, et le débit global s'effondre malgré des puces individuellement excellentes.

La physique impose aussi ses limites : le cuivre ne porte bien le signal que sur un mètre environ , au-delà les pertes et la chaleur explosent. D'où le basculement vers l' optique entre les baies , avec des modules enfichables puis co-packagés : la technologie NPO puis CPO rapproche la conversion optique à quelques millimètres de la puce. L'Atlas 960E illustre le gain avec 4 096 NPU, 8 EFLOPS en FP8 et 16 EFLOPS en FP4, seulement 5 500 modules Hi-ONE contre 48 000 modules 800G, et plus de 550 kW économisés.

Pour mesurer l'efficacité réelle, le récit mobilise le MFU , c'est-à-dire le rapport entre la performance utile et le pic théorique, popularisé autour de PaLM en 2022. Un MFU de 40 à 60 % est déjà considéré comme bon, alors que beaucoup de grappes plafonneraient vers 30 %. Les tests mis en avant promettent trois gains combinés : des transferts plus courts, des attentes réduites et des puces mieux nourries en données. Ensemble, ces effets relèveraient nettement le taux d'utilisation sans changer la gravure des processeurs.

Enfin, Huawei affiche sa feuille de route : l' Atlas 950 adopterait UnifiedBus 2.0 dès le dernier trimestre, tandis que le 960E reste sans date ferme et que l'Ascend 960 viserait environ 2027. Fait notable, la licence serait ouverte, avec déjà 30 000 téléchargements dans 26 pays, et un taux d'erreur ciblé d'une erreur pour 100 millions de bits contre une pour 100 000 auparavant. En toile de fond, la loi dite de Logic Folding et Tau , présentée à l'ISCAS 2026, esquisse des puces empilées où logique et mémoire se rapprochent durablement.

Visualization: nodesdaily AI

Moments clés

  1. Le choc des 945 TWh
  2. Des modèles de 5T vers 40T paramètres
  3. TCP/IP et les réseaux classiques
  4. NVLink et la falaise du calcul
  5. UnifiedBus et LinkBlade
  6. Mémoire distante en 100 ns
  7. Cuivre, NPO et optique
  8. Atlas 960E et licence ouverte

Commentaire de l’IA

"Le récit est clair et pédagogique : le problème n'est plus seulement la puissance des puces, mais le coût du déplacement des données. La démonstration de Shanghai convainc sur la physique, même si l'enthousiasme mérite d'être confronté aux chiffres indépendants. Une contribution utile pour comprendre l'infrastructure de l'IA."

Évaluation de l’IA

Le contre-argument le plus sérieux porte sur la généralité des gains : une interconnexion unifiée brille quand le trafic est dense et synchrone, mais beaucoup de charges réelles restent hétérogènes, avec des phases de calcul, de lecture et d'attente. Dans un cluster de 100 000 NPU où seulement 20 % de l'activité porterait un modèle donné, les améliorations mesurées sur un SuperPod témoin ne se transfèrent pas automatiquement à tout le parc.

Les limites tiennent aussi à la vérification indépendante : topologies exactes, versions logicielles, lots de test et conditions thermiques restent largement décrits par le fournisseur. Les chiffres de fiabilité comme la double fibre avec un temps moyen entre pannes d'un mois demandent des retours d'exploitation longs, et l'absence de date pour le 960E invite à distinguer la démonstration de la disponibilité commerciale.

Le contexte du présentateur compte : le voyage à Shanghai, organisé avec Huawei, offre un accès rare aux laboratoires mais crée un biais naturel de sympathie. Les ingénieurs interrogés défendent leur architecture avec conviction, et les angles critiques comme les coûts de migration, la dépendance au fournisseur ou les sanctions et contraintes d'exportation restent peu explorés dans le récit.

Concrètement, la leçon pour le lecteur est simple : avant d'ajouter des accélérateurs, auditez le réseau, la mémoire partagée et le MFU réel de vos charges. Les gains promis par UnifiedBus et LinkBlade sont plausibles sur le papier, mais un décideur avisé exigera des benchmarks répliqués, des prix totaux de possession et une stratégie de sortie avant de reconstruire son infrastructure.

Sources

9 liens ; aucun autre article publié ne les cite. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

intelligence artificielle · huawei · unifiedbus · centres de données · nvlink · énergie

Suivre le sujet

Avant cet article

Un court ordre de lecture des articles antérieurs reliés à cet événement par un éditeur.

Preuves et sources

Consultez les passages autorisés, leurs versions et leur origine.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…