Retour au fil

La prochaine course aux puces du billion de dollars sera gagnée en vendant des systèmes, pas des puces

Les dépenses d'inférence ont dépassé celles de l'entraînement, près de deux pour cent du produit intérieur brutal américain se dirige vers les infrastructures d'intelligence artificielle, et les systèmes intégrés à l'échelle du rack supplantent l'assemblage de composants. Austin Lyons explique, à travers la distinction préfill/décodage et l'essor des néoclouds, où pourrait émerger la prochaine société de puces valant un billion de dollars.

Importé dans Nodesdaily : (UTC+03:00)
Voir sur YouTube — bXNJU3RhW1I
Options de lecture

La lecture vocale n’est pas disponible dans ce navigateur.

Loupe à concepts

Choisissez un terme technique de cette vue pour lire sa définition générale, un exemple pédagogique et son usage dans l’article.

Aucun terme de notre glossaire n’a été trouvé dans cette vue. Le glossaire ne couvre pas encore tous les termes.

Aucune entreprise n'a encore mené jusqu'au marché une puce conçue spécifiquement pour les grands modèles de langage. Dans le podcast Tech Surge de Celestia Capital, l'analyste des semi-conducteurs Austin Lyons l'explique par une pure logique de marché : si le bénéfice n'est pas clair, personne ne modifie la chaîne de production. Les chiffres racontent désormais une autre histoire. Près de deux pour cent du produit intérieur brutal américain iront cette année aux infrastructures d'intelligence artificielle, soit presque le double du niveau de 2025. La rupture discrète s'est produite l'an dernier, lorsque les dépenses pour faire tourner les modèles en production ont dépassé celles consacrées à leur entraînement, et ce basculement remodelle chaque maillon, de l'acheteur au concepteur en passant par le fournisseur.

La manière dont les acheteurs du cloud acquièrent le matériel s'est inversée. Lyons se souvient qu'il y a une décennie, les clouds poussaient à la banalisation via les organismes de normalisation, négociant composant par composant pour faire baisser les prix. Aujourd'hui, la tendance est inverse : les clients préfèrent un rack entièrement intégré fourni par un seul fournisseur plutôt que d'assembler eux-mêmes les pièces. La raison tient au rythme et à la simplicité. En période de boom, le vainqueur n'est pas celui qui propose la nomenclature la moins chère, mais le système le plus rapide à déployer et à mettre en production.

L'argument en faveur de la vente de systèmes commence par l'échelle des modèles. Un modèle de pointe de plus de deux billions de paramètres nécessite encore un à plusieurs téraoctets de stockage de poids, même après quantification. Un seul accélérateur, lui, ne contient qu'environ 288 gigaoctets de mémoire à large bande passante. Cela oblige à répartir le modèle sur quatre ou huit accélérateurs, et une fois cette répartition effectuée, raisonner à l'échelle du rack devient inévitable. Le Grace Blackwell NVL72 de Nvidia incarne la réponse : 72 processeurs graphiques et 36 processeurs centraux fonctionnant comme un seul système, avec réseau, alimentation et refroidissement.

L'avantage de Nvidia tient à ce qu'il a atteint l'échelle du rack le premier. Selon Lyons, l'entreprise a assemblé la conception complète, la pile logicielle et la chaîne d'outils de compilation, et a rendu le rack complexe prêt à l'emploi. Une équipe de modèles peut écrire du code et l'exécuter, la complexité du rack restant masquée. L'industrie veut toujours plus de concurrence et de banalisation, mais quand la douleur de l'intégration est aussi élevée, le fournisseur qui livre en premier un rack fonctionnel fixe les règles du jeu.

Pourquoi un acheteur cloud accepterait-il des marges élevées à chaque couche plutôt que de mélanger les fournisseurs ? La réponse tient au délai de mise sur le marché. Lyons cite Elon Musk et xAI, qui ont déployé des centres de données en un temps record sur des racks intégrés, où la vitesse d'obtention de tokens utiles comptait plus que l'optimisation des coûts. Le rack Helios d'AMD montre la même dynamique. Tout le monde sait qu'une construction mixte pourrait être moins chère sur le papier, mais quand les fenêtres de déploiement se mesurent en jours, un rack intégré vaut bien la marge.

Cela relève la barre pour les startups. Lyons note que ce qui exigeait autrefois quelques millions de dollars en tours de financement de preuve de concept demande désormais des centaines de millions pour une startup de puces visant un produit à l'échelle du rack. Les acteurs en place renforcent leur avantage par des fusions comme Mellanox et des décennies de savoir-faire système. Pourtant, la fenêtre ne s'est pas refermée. À mesure que les interfaces mûrissent, des niches étroites où une startup peut vivre sans cloner un rack entier commencent à s'ouvrir, en particulier là où la charge de travail présente un goulot d'étranglement distinct.

La charge d'inférence elle-même se scinde, et cette scission façonne le choix du silicium. Dans la conversation, les deux phases sont décrites comme le préfill et le décodage. Le préfill est la lecture parallèle d'un long prompt, avide de calcul. Le décodage est la génération séquentielle de tokens, dominée par la vitesse de déplacement des données, ce qui fait de la bande passante mémoire le facteur décisif. L'ingénierie naturelle consiste à exécuter le préfill sur des pools riches en calcul et le décodage sur des pools centrés mémoire, et à les désagréger quand cela en vaut la peine.

Nvidia a codifié cette scission dans le logiciel avec une couche d'orchestration appelée Dynamo qui gère les pools de préfill et de décodage sur une même flotte de processeurs graphiques. Fait intéressant, les paris antérieurs de Groq et Cerebras prennent désormais leur sens. Les deux ont construit leurs architectures autour d'une abondante mémoire statique vive sur puce plutôt que d'une mémoire dynamique à condensateurs. Ce choix leur confère une très large bande passante sur puce, un ajustement presque parfait pour le côté décodage où la vitesse de déplacement des données compte le plus.

La contrainte déterminante dans les centres de données, c'est l'énergie. Une fois qu'un campus se voit allouer cent mégawatts, la question commerciale devient comment tirer le maximum de revenus par mégawatt. Lyons présente les choix de conception comme des questions financières dans une enveloppe fixe d'énergie, d'espace et de refroidissement : quel mélange de silicium produit le plus de sortie d'inférence. Le calcul permet même à d'anciens sites de minage de bitcoin de se réinventer en capacité cloud, où l'énergie bon marché et le capital adossé à des actifs leur permettent d'aller plus vite que les hyperscalers au déploiement lent.

Une nouvelle couche intermédiaire appelée néocloud a grandi dans cet interstice. La conversation explique pourquoi même Microsoft loue des processeurs graphiques à des néoclouds tout en construisant ses propres campus : l'énergie est rare, la location hors bilan est flexible, et les calendriers de la demande sont impitoyables. Les néoclouds apportent une expérience du financement d'actifs et déploient rapidement des capacités, les hyperscalers utilisent cette capacité louée comme tampon pendant l'extension de leurs campus en propriété, et le résultat est un étage intermédiaire qui vaut désormais plus de cent milliards de dollars.

La question ouverte est de savoir si les néoclouds peuvent durer. Ils servent des clients hyperscale tout en les concurrençant indirectement. Lyons attend une consolidation, mais pas une simple acquisition par les vendeurs de puces, en partie à cause des frictions réglementaires. Les néoclouds peuvent plutôt agréger eux-mêmes divers silicium et masquer la complexité en vendant des tokens en tant que service, en associant chaque tâche au matériel approprié. Si cela fonctionne, cela crée une voie d'accès au marché pour le silicium novateur, car la couche cloud prête à assumer l'hétérogénéité réduit le coût d'adoption pour les clients.

Les clouds finiront-ils avec un seul type de puce ou un large portefeuille ? Lyons cite les processeurs centraux comme précédent : aucun cloud n'offre aujourd'hui un seul processeur central, et la même logique s'appliquera à l'inférence. Imaginez une courbe où l'axe horizontal est l'interactivité, en tokens par seconde et par utilisateur, et l'axe vertical le débit total. Chaque point de la courbe est un produit différent, du chat à faible latence à la synthèse par lots en passant par le service de petits modèles le moins cher, et chaque point est le moins cher sur un mélange matériel différent.

L'ouverture valant un billion de dollars se situe peut-être au milieu de cette courbe, pas à la frontière. Le débat est obsédé par le plus grand modèle à deux billions de paramètres, or le plus gros volume se trouve peut-être dans les modèles ouverts de soixante-dix milliards de paramètres. Lyons observe que les anciennes cartes Hopper et Ampere y restent compétitives, si bien qu'un nouvel accélérateur ciblant ce milieu encombré avec une conception mémoire d'abord peut capturer un volume réel à meilleur prix sans avoir besoin de la plus haute intelligence.

Le dilemme construire ou acheter pour le silicium se précise également. Les principaux fournisseurs de modèles achètent des processeurs graphiques marchands à grande échelle tout en co-concevant des puces personnalisées avec des partenaires comme Broadcom et Marvell, les équipes de puces et de logiciels travaillant ensemble sur des charges spécifiques. Les vendeurs marchands, eux, n'inventent pas pour un seul client mais pour le marché large, laissant les idées d'architecture piloter la feuille de route. Comme avec OpenAI, les deux voies avancent en parallèle plutôt que de s'exclure.

La conception de puces elle-même s'accélère avec l'aide de l'intelligence artificielle. Le scénario esquissé dans l'émission est frappant : une conception qui exigeait autrefois trois ans et une centaine d'ingénieurs pourrait être réalisée en un an avec la même équipe ou une équipe plus réduite, ramenant le coût au tiers. Un supplément de deux mille dollars à la nomenclature qu'un directeur financier aurait retoqué devient viable à sept cents dollars. À mesure que la barre baisse, des équipes qui n'avaient jamais envisagé une puce personnalisée commencent à trouver le calcul faisable.

Cette même accélération aide les maisons de silicium marchand. Un ingénieur expérimenté utilise les outils d'accélération plus efficacement qu'une équipe débutante, si bien que les acteurs en place peuvent multiplier les variantes sous le même toit. Des marchés jugés autrefois trop petits pour justifier une gamme de produits peuvent franchir le taux de rentabilité interne une fois le coût divisé par deux, et les entreprises commencent à ajouter des offres semi-personnalisées à leurs catalogues. Les niches se multiplient tandis que le marché global offre des choix plus sur mesure.

Pour les startups, le tableau est à double tranchant. Concurrencer de front à l'échelle du rack est difficile, mais le coût de conception réduit ouvre de nouveaux espaces de variantes. Même les grands vendeurs donneront désormais leur feu vert à des gammes qu'ils avaient autrefois mises de côté comme non rentables. La concurrence se déplace de la quête de la meilleure puce unique vers la capacité à placer le bon silicium dans la bonne phase au bon prix, avec une orchestration qui rend l'hétérogénéité invisible pour le client.

La dernière phrase de la conversation est le meilleur résumé : tant de choses restent indécises, et cet état d'incertitude ne ralentit en rien les dépenses. Là où se croisent les limites énergétiques, l'architecture mémoire et l'orchestration logicielle, celui qui décrochera la couronne du billion de dollars reste incertain. Pourtant, l'essor du travail d'inférence, la normalisation des systèmes à l'échelle du rack et le modèle de capital des néoclouds semblent déjà bien ancrés. Dans cette course, le vainqueur ne sera pas celui qui attend la clarté, mais celui qui construit le système dans l'incertitude et maximise le revenu par mégawatt.

Visualization: nodesdaily AI

Commentaire de l’IA

""Ce qui m'a le plus frappé, c'est la façon dont la puce cesse d'être le héros solitaire et dont le modèle qui vend un système à l'intersection de l'énergie, de la mémoire et de l'orchestration logicielle prend le devant de la scène. Même à travers le prisme du matériel, la question financière est devenue décisive.""

Évaluation de l’IA

La force de cette analyse est de recadrer les infrastructures d'intelligence artificielle comme une compétition de systèmes et de modèles économiques, et pas seulement de puces. Placer la scission préfill/décodage sur les axes calcul et mémoire, expliquer le financement des néoclouds par la logique de l'énergie et du bilan, et relier l'échelle du rack à une question financière de revenu par mégawatt donne au propos une colonne vertébrale cohérente qui soutient aussi les arguments sur le portefeuille et la multiplication des variantes.

Les limites apparaissent dans la présentation et la datation des chiffres marquants. Des affirmations comme les deux pour cent du produit intérieur brutal ou le dépassement pour la première fois des dépenses d'entraînement par celles d'inférence arrivent arrondies et issues d'une seule source conversationnelle, avec un périmètre flou quant à leur caractère annuel ou trimestriel et aux postes de coûts inclus. Les quatre conditions promises pour la prochaine société de puces valant un billion de dollars sont annoncées d'emblée mais jamais détaillées comme une liste vérifiable, laissant le seuil vague.

L'enseignement pragmatique est d'acheter des racks intégrés plutôt que de composer pièce par pièce, de prioriser le revenu par unité d'énergie, et de planifier l'inférence non sur une seule famille de puces mais sur un portefeuille. Conserver les cartes de génération antérieure pour l'étage intermédiaire autour de soixante-dix milliards de paramètres, adosser la phase de décodage à des accélérateurs centrés mémoire, et orchestrer des pools de préfill et de décodage séparés avec une couche comme Dynamo améliore l'équilibre coût/vitesse sur l'année à venir.

Pour les startups et les équipes cloud, la voie pratique consiste à définir la niche autour d'un goulot d'étranglement sensible à la mémoire plutôt que d'affronter de front l'échelle du rack. L'exemple du mineur de bitcoin devenu néocloud montre que là où l'énergie et l'accès au capital existent, la vitesse devient un avantage, et faire tourner en parallèle du silicium marchand et personnalisé répartit le risque. Même si l'assistance de l'intelligence artificielle réduit le coût de conception, la discipline de fabrication et de portefeuille reste essentielle, sinon les gains de vitesse ne font que gonfler la prolifération des variantes.

Sources

6 liens ; 1 d’entre eux sont aussi cités par 2 autres articles. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

infrastructure ia · puce · inférence · système rack · nvl72 · néocloud · mémoire

Suivre le sujet

Avant cet article

Un court ordre de lecture des articles antérieurs reliés à cet événement par un éditeur.

Preuves et sources

Consultez les passages autorisés, leurs versions et leur origine.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…