Retour au fil

36 Billions d'Opérations par Seconde : l'Anatomie Secrète du GPU

De Mario 64 à Cyberpunk 2077, la puissance graphique a été multipliée par des centaines de milliers. Cette exploration démonte une carte à 28,3 milliards de transistors pour expliquer comment des milliers de cœurs simples surpassent les processeurs classiques.

Importé dans Nodesdaily : (UTC+03:00)
Voir sur YouTube — h9Z4oGN89MU
Options de lecture

La lecture vocale n’est pas disponible dans ce navigateur.

Loupe à concepts

Choisissez un terme technique de cette vue pour lire sa définition générale, un exemple pédagogique et son usage dans l’article.

Aucun terme de notre glossaire n’a été trouvé dans cette vue. Le glossaire ne couvre pas encore tous les termes.

Imaginez huit milliards de personnes posant chacune une multiplication par seconde, sans pause ni erreur. Il faudrait tout de même environ 4400 planètes peuplées pour égaler la puissance d'une carte graphique moderne. Le grand écart impressionne : Mario 64 se contentait de cent millions d'opérations par seconde, Minecraft exigeait cent milliards, tandis que Cyberpunk 2077 réclame près de 36 billions d'opérations chaque seconde. Un tel déluge tient dans un boîtier de quelques litres grâce à une architecture massivement parallèle , une mémoire vorace et un ordonnancement millimétré.

Cargo ou Avion de Ligne

La puce graphique aligne 10752 cœurs face aux 24 cœurs d'un processeur classique, mais la comparaison brute trompe. L'image du cargo face à l'avion de ligne éclaire le compromis : le navire transporte un volume immense lentement, l'avion livre peu mais vite. De même, le processeur gère des tâches variées, rapides et imprévisibles, tandis que la carte répète des calculs simples sur des montagnes de chiffres. Elle ne fait pas tourner de système d'exploitation , ne pilote ni clavier ni réseau , et assume cette spécialisation radicale.

Au centre de la carte trône une puce nommée GA102, gravée avec 28,3 milliards de transistors. Son plan s'organise en 7 grappes appelées GPC, chacune abritant 12 multiprocesseurs de flux. Chaque multiprocesseur combine des faisceaux de 32 cœurs CUDA , un cœur Tensor et un cœur de ray tracing , soit 10752 unités de calcul classiques, 336 unités matricielles et 84 unités de lancer de rayons. Les premières portent l'ombrage des jeux, les secondes accélèrent les transformations géométriques et l' intelligence artificielle , les troisièmes tracent la lumière.

Les Puces Défectueuses ne Partent pas à la Poubelle

Les cartes 3090 Ti, 3090, 3080 Ti et 3080 partagent le même dessin de puce, malgré des prix et performances distincts. L'explication tient à la fabrication : poussières et défauts de gravure abîment parfois quelques zones du silicium. Au lieu de jeter la plaquette, les ingénieurs isolent et désactivent le multiprocesseur fautif, grâce à une conception répétitive qui confine la panne. Les puces sont ensuite triées : intactes pour le haut de gamme, partiellement désactivées en dessous. La fréquence d'horloge et la mémoire embarquée achèvent de différencier les modèles.

Un cœur CUDA ressemble à une calculatrice d'environ 410000 transistors. Son circuit principal, fort de 50000 transistors, exécute l'opération A multiplié par B plus C, baptisée multiplication-addition fusionnée . La moitié des cœurs manie des flottants de 32 bits, l'autre jongle entre entiers et flottants, des sections voisines gérant signes, décalages et files d'instructions. Chaque cœur boucle une multiplication et une addition par cycle : avec 10496 unités à 1,7 gigahertz, on atteint 35,6 billions d'opérations par seconde. Divisions et racines carrées restent confiées à des unités spéciales .

Faim de Mémoire et Astuces de Signal

Autour de la puce, la carte ressemble à une centrale miniature vissée sur un circuit imprimé . Un module de régulation convertit le 12 volts en 1,1 volt et déverse des centaines de watts vers la puce. Quatre caloducs conduisent cette chaleur vers des ailettes ventilées, ce qui explique le poids de l'engin. Les 24 gigaoctets de GDDR6X accueillent le décor : au chargement, les modèles migrent du SSD vers la mémoire vidéo . Le bus de 384 bits débite 1,15 téraoctet par seconde, contre 64 gigaoctets côté processeur.

Transmettre autant de données impose de ruser avec le signal. La GDDR6X code deux bits par niveau grâce à quatre tensions, dit PAM-4. La génération suivante adopte un codage ternaire : trois bits binaires deviennent deux chiffres à trois états, avec des tensions positive, nulle et négative. Ce PAM-3 simplifie l'encodeur, clarifie le signal et économise l'énergie. Pour les accélérateurs d' intelligence artificielle , la mémoire HBM empile des couches de DRAM reliées par des traversées de silicium, avec jusqu'à 192 gigaoctets à haut débit autour de la puce.

Une Instruction pour des Millions de Données

Certains calculs se découpent aisément, et le rendu 3D en fait partie. Prenez un chapeau de cow-boy : environ 28000 triangles issus de 14000 sommets repérés en X, Y et Z dans l'espace du modèle. Pour l'installer dans le monde virtuel, il suffit d'ajouter la position de l'objet à chaque coordonnée, instruction unique répétée sur des millions de nombres. Avec 5629 objets et 8,3 millions de sommets, la scène réclame 25 millions d'additions indépendantes, distribuées aux milliers de cœurs. C'est le parallélisme embarrassant , ou une instruction, plusieurs données .

Chaque instruction est portée par un fil d'exécution ; 32 fils forment un faisceau nommé warp. Les faisceaux forment des blocs confiés aux multiprocesseurs, réunis en grilles que pilote le moteur Gigathread . Jadis, les 32 fils avançaient au pas comme une phalange ; depuis 2016, l'architecture SIMT laisse chacun avancer à son rythme avec son compteur ordinal . Les fils partagent un cache L1 de 128 kilo-octets, mais les branchements divergents imposent des resynchronisations coûteuses. Le mot warp viendrait du métier à tisser Jacquard, pas des voyages spatiaux.

La même machinerie excelle au-delà du jeu. Pour valider un bloc de bitcoins, l'algorithme SHA-256 mélange transactions, horodatage et un nombre aléatoire nommé nonce, comme une loterie aux tickets tirés au hasard. Une carte produit environ 95 millions de tickets par seconde, mais les circuits spécialisés ASIC alignent 250 billions de tirages, soit 2600 cartes. Les cœurs Tensor multiplient des matrices entières en une fois, pain quotidien des réseaux de neurones . Les cœurs de ray tracing , eux, simulent les rayons lumineux pour des reflets crédibles.

Visualization: nodesdaily AI

Moments clés

  1. 4400 Terres pour une carte graphique
  2. Le cargo et l'avion de ligne
  3. Anatomie d'un cœur CUDA
  4. 1,15 To/s : nourrir la bête
  5. Le chapeau de cow-boy en 28 000 triangles
  6. Loterie bitcoin et matrices d'IA

Commentaire de l’IA

"La pédagogie visuelle rend limpide ce qui reste d'habitude abstrait : la hiérarchie des cœurs, la mémoire affamée et le parallélisme massif. Le détour par le minage et l'intelligence artificielle montre pourquoi cette architecture dépasse le jeu vidéo. Une mention unique du fabricant de mémoire invite toutefois à garder un regard critique sur le passage consacré à la GDDR et à la HBM."

Évaluation de l’IA

L'objection la plus sérieuse porte sur la comparaison elle-même : aligner 10752 cœurs graphiques face à 24 cœurs généralistes impressionne, mais les deux ne font pas le même métier. Dès que la tâche exige peu de données, des décisions rapides ou des branchements imprévisibles, le processeur reprend l'avantage et la carte redevient un simple accélérateur dépendant. Présenter le GPU comme absolument plus puissant gomme cette complémentarité.

Le récit reste aussi incomplet sur deux points : la consommation de plusieurs centaines de watts et le rôle du logiciel, pilotes et moteurs de jeu, sont à peine évoqués. Surtout, le passage sur la mémoire porte la marque du commanditaire, fabricant des puces GDDR et HBM : l'éloge de la GDDR7, de la HBM3E et des trente pour cent d'économie d'énergie ressemble à un argumentaire commercial, concentré en une seule séquence qu'il faut regarder avec distance.

Pour le lecteur, l'apport durable n'est pas le catalogue de chiffres mais la grammaire du parallélisme : une instruction répétée sur des millions de données, des faisceaux de trente-deux fils, un ordonnanceur qui répartit les blocs. Retenir le cargo et l'avion, le tri des puces imparfaites et le métier à tisser suffit à comprendre pourquoi le jeu, le minage et les réseaux de neurones partagent la même machinerie.

Sources

6 liens ; 1 d’entre eux sont aussi cités par 1 autre article. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

carte graphique · architecture gpu · cœurs cuda · mémoire gddr · ray tracing · intelligence artificielle

Suivre le sujet

Avant cet article

Un court ordre de lecture des articles antérieurs reliés à cet événement par un éditeur.

Preuves et sources

Consultez les passages autorisés, leurs versions et leur origine.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…