Retour au fil

Google vend ses propres TPU : la porte fermée depuis onze ans s'ouvre

En 2026, Alphabet a annoncé livrer des systèmes d'accélérateurs TPU dans les centres de données de ses clients et ouvrir une partie de sa couche logicielle à d'autres matériels. Le vrai goulot d'étranglement du secteur n'est ni la conception ni le capital, mais la mémoire à bande passante élevée et l'électricité du réseau.

Importé dans Nodesdaily : (UTC+03:00)
Voir sur YouTube — HneK5AIUUDo
Options de lecture

La lecture vocale n’est pas disponible dans ce navigateur.

Loupe à concepts

Choisissez un terme technique de cette vue pour lire sa définition générale, un exemple pédagogique et son usage dans l’article.

Aucun terme de notre glossaire n’a été trouvé dans cette vue. Le glossaire ne couvre pas encore tous les termes.

Le 29 avril, et non le 15 septembre , Alphabet a annoncé quelque chose d'inattendu lors de son appel aux résultats trimestriels. Le PDG Sundar Pichai s'est adressé à un large éventail d'acheteurs, des laboratoires d'IA aux sociétés de marchés financiers, avec une seule phrase : la demande de TPU augmentant, l'entreprise allait commencer à livrer des TPU sous forme matérielle dans les centres de données d'un groupe sélectionné de clients. Pendant des années, la seule voie consistait à louer de la capacité via Google Cloud, et le silicium ne quittait jamais les bâtiments de Google. Pichai a présenté ce changement comme un moyen d'élargir le marché adressable. Au deuxième trimestre, la directrice financière Anat Ashkenazi a confirmé qu'Alphabet avait comptabilisé pour la première fois des revenus de vente de systèmes TPU livrés dans des centres de données clients, la majeure partie des revenus contractualisés étant attendue en 2027. Elle a cité un projet avec une coentreprise soutenue par Blackstone.

La vidéo décrit une annonce en trois parties . Les deux premières sont essentiellement réelles ; la troisième est largement inventée. La première est correcte : des systèmes TPU quittent désormais les bâtiments de Google pour être installés chez les clients. La deuxième va dans la bonne direction : Google teste TorchTPU en avant-première avec des clients sélectionnés, en apportant un support natif de PyTorch sur TPU, et étend la couverture de vLLM. Mais la troisième partie, présentée comme une clause dissimulée en page neuf — le fait que les modèles Gemini pourraient s'exécuter sur l'infrastructure des clients, hors de Google Cloud — n'apparaît dans aucune communication officielle. Ce qui a été annoncé, c'est la vente d'une puce, pas le déplacement d'un modèle.

La question du calendrier a une réponse documentée, et c'est la section la plus solide de la vidéo. La décision de Google de concevoir sa propre puce en 2013 marque le début de l'IA d'entreprise. L'histoire racontée sur le blog Google Cloud est la suivante : le scientifique en chef Jeff Dean a réalisé que si chaque utilisateur dans le monde parlait à Google trois minutes par jour, le nombre de centres de données de l'entreprise devrait doubler. Au prix du calcul de l'époque, c'était une facture que personne ne pouvait payer. Concevoir un ASIC prenait normalement des années ; le TPU est passé de la première conception au déploiement en production en quinze mois . Le rétrospectif de Jouppi publié en 2023 explique pourquoi cela ne relevait pas du hasard : un calendrier limité à un seul objectif, une fréquence d'horloge de 700 MHz qui facilitait la clôture temporelle, et un procédé mature de 28 nanomètres.

L'architecture du TPU est le cœur technique du récit. Ce que les ingénieurs appellent un tableau systolique est une grille de milliers de petites cellules multiplicatrices câblées directement entre elles, les données circulant comme de l'eau dans un tuyau et se multipliant à chaque jonction sans revenir à un contrôleur central. Ce type de conception supprime les allers-retours vers la mémoire que les processeurs généralistes, et à un moindre degré les GPU, exigent pour les réseaux de neurones. L'article sur le TPU v1 publié en 2017 a mesuré la puce à 80 fois les performances par watt des processeurs de l'époque et 30 fois celles des GPU . Ce que la vidéo omet est un détail déterminant : le premier TPU effectuait de l' inférence uniquement , l'entraînement restant sur les GPU. Google a ensuite séparé les deux lignes, et à la huitième génération, TPU 8t gère l'entraînement et TPU 8i l'inférence.

L'avantage le plus mal compris de Nvidia n'est pas le silicium, c'est le logiciel — et sur ce point, la thèse centrale de la vidéo tient. Concevoir sa propre puce ne protège que soi-même ; cela ne change pas l'industrie. Pendant quinze ans, les rivaux ont fabriqué des puces impressionnantes sans rien obtenir, parce que la couche logicielle CUDA était inscrite dans les réflexes de chaque tutoriel, de chaque bibliothèque et de chaque étudiant en master. SemiAnalysis estime que le coût total de possession de systèmes TPU déployés est environ 30 à 44 pour cent inférieur à celui de déploiements Nvidia GB200 et GB300 comparables. C'est précisément l'écart que Google attaque : TorchTPU vise à offrir l'avantage du logiciel à ceux qui ne louent pas le matériel de Google pour l'obtenir.

Le panorama concurrentiel présente une symétrie inconfortable . Amazon livre les Trainium et Inferentia depuis des années et les facture au sérieux. Microsoft dispose d'un solide programme d'accélérateurs internes. Meta conçoit des accélérateurs MTIA avec Broadcom pour les tâches de classement et de recommandation, et prévoit un déploiement massif de MTIA 500 fin 2027. Google ne met pas seulement Nvidia sous pression. Le marché coréen le montre. S&P Global Ratings attend que la Corée du Sud investisse environ 1 200 billions de wons dans la construction de centres de données d'ici 2035, ce qui en ferait le deuxième marché d'Asie-Pacifique après la Chine. Le 9 septembre, Google a rencontré des responsables de haut rang du Comité de la stratégie nationale de l'IA, et les analystes du secteur y lisent un signal que la Corée devient l'un des principaux foyers d'activité TPU de Google.

Sur les chiffres, les estimations d'analystes vont dans le sens de la thèse, même si l'échelle ne correspond pas. Morgan Stanley projette des ventes directes de TPU de 84 milliards de dollars en 2027 et de 108 milliards en 2028, en cohérence avec l'hypothèse de TF International Securities d'un envoi de 0,3 gigawatt au second semestre 2026, 3,2 gigawatts en 2027 et 4,2 gigawatts en 2028. TF modélise également cette activité à 30 pour cent de marge brute, ce qui revient à reconnaître que le commerce de matériel est structurellement plus mince que la location de cloud. Thomas Kurian, directeur de Google Cloud, a déclaré que l'activité TPU est plus de deux fois celle du deuxième fournisseur d'accélérateurs, et que le retour sur investissement des serveurs est inférieur à deux ans, le processeur de Google le remboursant en environ la moitié du temps d'un GPU. Ce sont des estimations de direction, et non des données trimestrielles auditées.

Les chiffres de trésorerie sur lesquels la vidéo s'appuie le plus sont également faux dans leur majeure partie. Le montant de 93 milliards de dollars de dépenses d'investissement 2026 confond un chiffre trimestriel et un chiffre annuel. Le chiffre réel est un guidage de 180 à 190 milliards de dollars de dépenses d'investissement pour 2026, relevé d'une fourchette de 175 à 185 milliards. Au deuxième trimestre, les dépenses d'investissement ont atteint 44,9 milliards de dollars pour 39,1 milliards de flux de trésorerie opérationnel, laissant un flux de trésorerie libre négatif de 5,9 milliards de dollars . Une analyse parle même d'une émission de 80 milliards de dollars d'actions nouvelles, la première depuis l'introduction en bourse de 2004. À l'inverse, l'action Alphabet a reculé d'environ 3,8 pour cent un jour où le chiffre d'affaires de Google Cloud a progressé de 82 pour cent sur un an.

Le côté Nvidia est plus complexe. L'entreprise a annoncé 215,9 milliards de dollars de revenus pour l'exercice 2026 , en hausse de 65 pour cent, avec un chiffre d'affaires trimestriel record de 62,3 milliards de dollars pour le centre de données. La marge brute s'est établie à 71,1 pour cent sur l'exercice et 75,0 pour cent au quatrième trimestre — le fameux chiffre de 70 pour cent s'est donc révélé presque juste par hasard. L'action, toutefois, a reculé depuis un record de 236 dollars fixé le 14 septembre, tombant à 225,51 dollars le 23 septembre et autour de 221 dollars le 24 septembre, la laissant environ 15 pour cent sous son sommet . Le cadrage de la vidéo sur un premier vrai problème depuis trois ans pointe dans la bonne direction : l'interprétation de TechCrunch est que le marché ne renégocie pas une demande faible, mais le prix du calcul lui-même.

Pour comprendre la manœuvre, il est utile de savoir pourquoi la puce n'a jamais été vendue pendant onze ans. En 2016, AlphaGo a battu le meilleur joueur du monde de go lors d'une diffusion en direct, et des centaines d'articles ont attribué la victoire aux algorithmes et aux réseaux de neurones. Très peu de gens se sont demandé sur quoi tournait la machine. Elle tournait sur le silicium de Google, et l'apparition constituait une démonstration, pas un lancement. La logique tenait à l'époque : il n'y a aucune raison de donner à un concurrent la seule chose qu'il ne peut pas acheter. Chaque conversation commerciale de Google Cloud depuis 2018 reposait sur l'idée que seul Google possédait cela. Ce contexte a changé : puisque Google cède le logiciel, vendre le matériel ne comporte aucun coût concurrentiel.

Deux goulots d'étranglement : mémoire et électricité

L'observation la plus concrète de la vidéo se vérifie ici : la véritable limite du matériel d'IA n'est pas la conception mais la mémoire à bande passante élevée. La HBM empile de fines couches de silicium les unes sur les autres et y perfore des milliers de canaux verticaux, reliés avec une précision mesurée en fractions de micron. Si une seule couche échoue, toute la pile devient sans valeur. Selon NetworkWorld, Samsung, ayant basculé sa capacité vers la HBM et la DRAM haut de gamme, a porté le prix d'un module DDR5 de 32 Go de 149 à 239 dollars en 2026, une hausse de 60 pour cent. SK Hynix a déclaré que sa capacité en HBM, DRAM et NAND était « essentiellement épuisée » pour 2026. Micron a quitté entièrement le marché de la mémoire grand public. Selon un dirigeant de Micron, la HBM consomme environ trois fois la capacité en plaques de silicium de la DRAM standard par gigaoctet.

L'ampleur de cette contrainte mérite d'être posée clairement. Nvidia a obtenu des engagements couvrant environ 37 pour cent de la production mondiale de HBM pour 2027 , et dans le document trimestriel publié en août, ses engagements d'approvisionnement et de capacité ont bondi de 119 à 279 milliards de dollars en un seul trimestre. Morgan Stanley estime que Nvidia, Alphabet et AMD représentent à elles trois environ 85 pour cent de la production de HBM projetée pour 2027 , laissant 15 pour cent à tous les autres développeurs de matériel d'IA. Des estimations indépendantes situent les expéditions unitaires entre 2,76 millions en 2024 et jusqu'à 8,8 millions d'ici 2027. L'allocation, et non la conception, est devenue la compétition. L'objectif de Micron de 100 000 plaques HBM par mois d'ici la fin de l'année ne change rien à cette donne : les estimations du secteur situent Samsung et SK Hynix entre 150 000 et 200 000 plaques chacune.

Le second goulot d'étranglement est l'électricité et le raccordement au réseau , et c'est peut-être le plus difficile à résoudre. Les données de suivi d'Accuris situent la demande d'énergie des centres de données américains à 80 gigawatts en 2025, projetés à 150 gigawatts d'ici 2028, avec une consommation mondiale d'électricité approchant 1 050 térawattheures , soit l'équivalent d'un réseau national de taille moyenne. Les centres de données doivent consommer 70 pour cent de la production de mémoire, et le même rapport indique que 30 à 50 pour cent des capacités de centres de données d'IA prévues pour 2026 glissent à 2028 en raison des files d'attente de raccordement et des goulots de construction. Des commissions locales en Virginie, en Géorgie et en Alabama délibèrent encore sur l'opportunité de laisser les centres de données se raccorder pendant que les tarifs résidentiels augmentent. L'intuition finale de la vidéo est donc juste : le facteur limitant de cette course n'est peut-être pas la puce, mais l'autorisation d'utiliser le terrain et de se raccorder au réseau.

Cinq signaux à surveiller

La section la plus utile de la vidéo est sa liste d'observation, même si les chiffres sont faux. Le premier signal est la confirmation publique par un tiers que des charges de production tournent sur ce matériel dans ses propres installations, car les annonces seules ont un mauvais historique face aux calendriers de livraison. Le deuxième est la publication par un client de son coût par unité de travail comparé à ce qu'il payait auparavant. Quand ce chiffre apparaîtra, une véritable comparaison économique remplacera le marketing. Le troisième est la réaction de l'incumbent : baisser les prix, regrouper davantage, ou accélérer l'architecture. Une baisse de prix rapide signale la détresse ; le silence signale la confiance. Le quatrième signal est la position d'Amazon et de Microsoft. Les deux Fury Executors Concealed produisent leur propre silicium, ce qui fait du TPU de Google un concurrent. Mais la couche logicielle de Google est gratuite et fonctionne sur n'importe quoi, y compris leurs propres puces. Adopter le paquet ouvert d'un rival est un choix difficile sans couverture gouvernementale. Le cinquième concerne les accords d'approvisionnement de long terme : qui secured la capacité HBM jusqu'en 2029 a déjà gagné des batailles qui n'ont pas commencé. Morgan Stanley fournit un repère concret : le projet d'Anthropic d'étendre son déploiement de TPU de 1 gigawatt cette année à 5 gigawatts l'an prochain doit être lu comme un signe de tension sur l'offre, non de faiblesse de la demande.

L'erreur de la vidéo ne porte pas sur l'existence de l'annonce, mais sur sa date et son ampleur. Ce qui s'est réellement produit suffit largement à Hooker : une puce refusée à la vente en 2015 s'est ouverte au milieu du plus grand basculement d'infrastructure depuis une génération, en cassant son propre modèle de marge pour devenir un standard. Pour mesurer l'audace de cette manœuvre, il suffit de penser qui d'autre pourrait la faire. L'objectif final de la concurrence n'est pas de surpasser un rival, mais de devenir ce dont un rival ne peut pas se passer. Après onze ans, la préférence pour conserver l'ancien outil à l'intérieur des murs a disparu.

Visualization: nodesdaily AI

Moments clés

  1. L'affirmation des 300 milliards
  2. Une annonce en trois parties
  3. D'ou vient le chiffre de capex
  4. GPU contre TPU
  5. La barriere logicielle de Nvidia
  6. La chaine Broadcom et TSMC
  7. Le calcul de la recherche vocale en 2013
  8. Quinze mois jusqu au silicium
  9. AlphaGo et la decision du secret
  10. Le goulot de la memoire
  11. Les files de raccordement
  12. Le cadrage de septembre 2026
  13. Un positionnement pour l'inference
  14. L'affirmation de la page neuf
  15. L'analogie du passager de 2017
  16. Cinq signaux a surveiller
  17. Materiel ou plateforme

Commentaire de l’IA

"Le cadrage de la vidéo est séduisant, mais l'essentiel de ses chiffres ne résiste pas à la confrontation aux archives. Il n'existe ni annonce du 15 septembre ni chiffre de 1,4 million de puces : la disclosure réelle date de l'appel aux résultats du 29 avril, et les premières ventes de matériel ont été comptabilisées au deuxième trimestre. La thèse de fond tient néanmoins : Google sacrifie volontairement sa marge matérielle pour devenir la plateforme par défaut."

Évaluation de l’IA

L'argument le plus solide de la vidéo est que l'écosystème logiciel, et non le matériel, rend Nvidia durable, et elle pose cet argument correctement. Pendant quinze ans, les rivaux ont fabriqué leurs propres accélérateurs et rien n'a fonctionné, car l'obstacle était une habitude, pas une architecture. La poussée de Google vers TorchTPU attaque exactement cette chaîne. Mais les chiffres avancés sont en grande partie inventés. L'estimation de SemiAnalysis sur un avantage de coût de 30 à 44 pour cent provient d'une source unique et concerne des systèmes déployés, pas une comparaison puce à puce. Un débit supérieur ne signifie pas automatiquement un coût total inférieur, car l'effort de portage logiciel et la planification de capacité n'apparaissent pas dans ce chiffre.

Le problème le plus sérieux est la fabrication du calendrier et de l'ampleur. La date annoncée du 15 septembre 2026 est en réalité l'appel aux résultats du 29 avril. L'affirmation selon laquelle Nvidia aurait perdu plus de 6 pour cent sur deux séances, effaçant 300 milliards de dollars, ne correspond à aucun enregistrement : l'entreprise affichait alors des revenus record et son action approchait des plus hauts historiques. Le chiffre de 1,4 million d'unités ne provient pas non plus de Google, mais d'une estimation d'analyste qui n'a jamais figuré dans l'annonce. La prévision Morgan Stanley qui utilise bien 1,4 million d'unités pour 2027-2028 paraît raisonnable aux côtés de sa projection de 84 milliards de dollars de revenus. La vidéo raconte donc un développement réel avec une date fausse et une ampleur inventée, ce qui coûte la confiance du lecteur.

La plupart des déductions de l'orateur sont raisonnables, mais une mérite davantage de scepticisme. L'idée que Google ne lance pas un produit mais ouvre une sortie est élégante mais techniquement vague : Google livre des systèmes physiques dans les installations de ses clients tout en restant fournisseur de cloud, et TF International modélise cette activité à 30 pour cent de marge brute, très en dessous du cloud. Ce n'est pas renoncer à la barrière de défense, c'est ajouter une activité à faible marge. La transition de Bitcoin en 2017 a suivi un schéma similaire, les plateformes ayant ouvert leur infrastructure avant de rester un temps à la fois lieu de marché et fournisseur. Le chiffre de 30 pour cent mérite une vérification indépendante : tant qu'Alphabet refuse de détailler cette activité, la base de marge de tout le scénario de croissance reste non vérifiée.

L'implication pratique est claire. Ceci est un signal directionnel, pas un signal de trading. Les résultats de Nvidia restent solides : revenus en hausse de 65 pour cent, trimestres records dans le centre de données, marge brute de 71 pour cent. Mais la valorisation repose désormais moins sur le trimestre suivant que sur celui qui fixe le prix du calcul. TechCrunch, en citant des données Ornn, désigne le mécanisme : le prix au spot d'une heure de calcul H100 a atteint un pic d'environ 3,20 dollars en mai et recule depuis. Quand le prix d'une heure de calcul baisse, la marge se comprime pour tous ceux qui louent ces puces. Trois éléments méritent d'être suivis : les coûts publiés par unité de travail, le rythme de mise en service chez des clients comme Anthropic et Crux, et l'élargissement ou non par Nvidia de ses propres allocations de HBM au prochain trimestre.

Sources

11 liens ; aucun autre article publié ne les cite. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

tpu · nvidia · puces ia · centre de données · hbm · alphabet

Suivre le sujet

Avant cet article

Un court ordre de lecture des articles antérieurs reliés à cet événement par un éditeur.

Preuves et sources

Consultez les passages autorisés, leurs versions et leur origine.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…