Une ouverture anti-doomer
La scène du podcast All-In ressemblait moins à une démo d'entreprise qu'à une thèse. Naveen Rao s'est placé frontalement contre le récit catastrophiste et a présenté l'intelligence artificielle comme la prochaine marche évolutive de l'humanité. Selon lui, l'échelle logicielle seule ne suffira pas, le substrat physique doit être refondé. Une curiosité d'enfant née d'un ordinateur familial en 1978 l'a conduit du génie électrique vers des questions inspirées par la science-fiction sur la machine intelligente, puis vers un doctorat en neurosciences. Cet arc personnel donne au propos technique un prologue humain : comprendre l'intelligence exige de savoir la construire.
Le parcours entrepreneurial a éprouvé cette idée sur le terrain. En 2014, alors que l'intelligence artificielle n'était pas encore un langage courant, il fonde ce qu'il décrit comme la première entreprise de puces pour l'IA, Nervana Systems, un pari matériel difficile à vendre à l'époque. Le rachat par Intel est jugé précoce par lui-même, suivi par la direction du groupe IA chez Intel. Après ce chapitre, la question s'élargit : comment bâtir l'infrastructure qui permet d'entraîner de grands modèles de langage. La plateformisation des GPU et la facilitation de l'entraînement à grande échelle deviennent MosaicML, accélérée après la percée générative fin 2022 et rejointe par Databricks en 2023. Son indication qu'environ un quart du revenu de Databricks en découle éclaire pourquoi l'histoire d'échelle convainc.
Unconventional AI est présenté non comme une suite mais comme une remise à plat aux premiers principes. L'objectif est de reconcevoir l'ordinateur resté largement identique depuis des décennies, pour la seule efficacité énergétique. L'objectif initial d'un gain de mille fois en cinq ans a été avancé à trois ans et demi car les progrès ont été plus rapides que prévu, paradoxalement accélérés par l'IA elle-même sur des problèmes scientifiques profonds. L'entreprise est verticale de bout en bout : des théoriciens aux profils math et neurosciences proposent des idées qui réduisent le déplacement d'information, les équipes modèles transforment ces idées en systèmes entraînés sur des données réelles et évalués sur des critères réels, des architectes de circuits et designers silicium incarnent la physique, et une équipe système boucle jusqu'à la carte et au rack.
Le mur énergétique et la preuve biologique
Rao répond à la question de l'énergie par un instantané mono-entreprise. Google, cité pour sa transparence, traiterait environ 3,2 quadrillions de tokens par mois. Même avec une hypothèse basse de 10 joules par token, cela donne environ 12 gigawatts. Les États-Unis consacrent environ 40 gigawatts aux centres de données, soit la moitié de la capacité mondiale, laissant le total mondial sous 100 gigawatts. Dans ce calcul, les seuls services génératifs d'un fournisseur pèsent déjà plus d'un dixième de la puissance mondiale des centres de données. Si la taille des modèles et la demande croissent ensemble, une butée physique d'ici environ trois ans est la projection avancée. Vu en graphique, une courbe de marché exponentielle vers un trillion de dollars en 2030 diverge d'une courbe énergétique linéaire en dessous, l'écart est le problème à résoudre.
Cet écart a déjà transformé la façon de penser les centres de données. La contrainte principale était jadis la surface au sol, puis l'équipement réseau, puis les GPU ; aujourd'hui c'est l'énergie. La première question est le contrat énergétique, ensuite comment le remplir d'infrastructure. Environ la moitié du coût de service d'un token est l'énergie, le reste est le capital matériel, l'espace et les coûts associés. La logique s'est simplifiée : on sécurise un contrat de puissance et on doit monétiser chaque watt. Le cas d'affaires de Rao s'inscrit exactement là : monétiser le même watt mille fois mieux que le matériel établi.
La biologie intervient comme preuve d'existence. Le cerveau humain fonctionne autour de 20 watts, un cerveau de singe près de 1 watt en extrapolation linéaire, un cerveau d'écureuil autour de 8 milliwatts. Votre téléphone consomme environ 1 watt, vous pourriez donc alimenter théoriquement plus de cent cerveaux d'écureuil avec lui, et ce minuscule cerveau exécute un comportement extrêmement précis — des sauts de branche en branche avec une précision quasi parfaite des milliers de fois. La maxime favorite de Rao revient : on ne comprend vraiment que ce que l'on sait créer. Les systèmes intelligents actuels produisent des sorties impressionnantes mais par une voie inefficace, et le coupable est surtout le déplacement d'information.
Les chiffres rendent l'inefficacité tangible. Le cortex humain déplace environ 16 milliards de bits par seconde, un processeur graphique haut de gamme près de 30 billions de bits par seconde hors puce vers la mémoire, et le déplacement sur puce est dix à cent fois supérieur. Les systèmes synthétiques brassent des ordres de grandeur plus de bits que le cerveau, et ce mouvement tire la facture énergétique. Les ordinateurs existent depuis des siècles sous formes mécaniques, analogiques puis numériques, pourtant l'Eniac de 1945 — construit pour calculer des trajectoires d'artillerie plus vite que des calculateurs humains — partage l'opération de base d'aujourd'hui : mémoire à l'extérieur, calcul qui navette des bits. Cette conception a optimisé la vitesse plutôt que l'efficacité, et l'hypothèse est aujourd'hui réexaminée.
Faire tourner la physique directement
Le nombre de transistors a continué d'augmenter tandis que la fréquence et les gains mono-thread ont calé et que les gains d'efficacité se sont essoufflés, la réduction lithographique comme repas gratuit s'est largement tarie. Rao plaide de ne pas ajouter une nouvelle couche d'abstraction mais de couper les intermédiaires. Même les uns et zéros numériques sont une abstraction sur la physique ; un transistor possède des états intermédiaires que nous forçons à imiter le binaire. Par-dessus, nous empilons des réseaux de neurones, chaque couche étant imparfaite et incomplète. La proposition est de prendre une abstraction de la physique des semi-conducteurs elle-même et de la connecter directement au réseau neuronal, à l'image du cerveau qui fait émerger l'intelligence de la physique neuronale sans algèbre linéaire ni virgule flottante en citoyens de première classe. La même intuition apparaît dans la nature, où des oiseaux en nuées et des fourmis résolvent des problèmes via des règles locales simples, étudiées comme systèmes dynamiques où le comportement collectif émerge de la dynamique des composants.
Une intuition concrète vient des métronomes. Placez-en plusieurs sur une planche rigide qui peut légèrement rouler, et leurs poussées sur la planche finissent par les verrouiller sur la même phase, même en partant désynchronisés. Des centaines peuvent se synchroniser ainsi, et avec des couplages différents on obtient des motifs groupés où la moitié partage une phase et l'autre la phase opposée. C'est un système physique dont le résultat émerge de l'interconnexion elle-même. La question devient de savoir si un tel système physique peut calculer, et Unconventional AI tente d'y répondre via l'IA générative. Son modèle d'image à oscillateurs UNO, publié en simulation ouverte, a montré échelle, entraînabilité et sortie utile, avec différentes trajectoires d'espace d'état selon les conditions comme avion, voiture ou oiseau, et a livré de vraies images générées.
L'avancée la plus décisive ajoutée récemment est la sparsité. Connecter dix éléments en complet demande 100 liens, mille en demandent un million, et la mise à l'échelle quadratique devient vite douloureuse. La sparsité demande si de nombreux liens peuvent être supprimés tout en préservant le comportement collectif, et la réponse s'est avérée meilleure que la préservation : le système plus clairsemé peut être plus entraînable. C'est un rare triple gain d'efficacité supérieure, de meilleure scalabilité et de performance accrue qui tient aussi sur le matériel physique réel, présenté comme la récompense d'avoir bien posé le problème.
Le moment le plus affirmé a été l'annonce du premier ordinateur dynamique physique jamais construit. L'entreprise a démarré pour de bon en janvier, a envoyé le dessin en fabrication début juin, et la puce est revenue au laboratoire avec des premiers résultats — les premières images présentées comme générées directement sur ce matériel. Le périmètre ne se limite pas aux images ; la modélisation de séquences et les tâches de langage sont visées. L'énergie par image est le titre : environ 500 nanojoules contre des millijoules sur un processeur graphique, un écart mesuré en ordres de grandeur parce que presque aucune information n'est convoyée. L'équipe a présenté cela comme preuve que l'approche fonctionne et a souligné qu'elle le partageait publiquement pour la première fois sur cette scène.
Architecturalement la lignée est claire : des CPU aux GPU puis à des sous-systèmes toujours plus parallèles, tous sont restés des machines von Neumann qui séparent mémoire et calcul et charrient des bits. Le nouveau système est décrit comme un ordinateur dynamique où calcul et mémoire sont la même chose sans interface mémoire ; chaque élément de calcul est aussi une mémoire. L'entreprise appelle cela le calcul 4D, avec une dimension de temps dans la dynamique et trois dimensions physiques issues de l'empilement de puces verticalement et en plan. L'objectif produit à court terme est un système complet de type rack pour centre de données d'ici environ deux ans, apparaissant de l'extérieur comme des tokens qui entrent et sortent par un câble réseau tandis que l'intérieur est entièrement différent. Le portage se fera au niveau modèle plutôt qu'opérateur, avec un peu de calcul nécessaire pour convertir les modèles existants, et même des opérations de base comme la multiplication matricielle sont réinterprétées non comme un circuit figé mais comme un comportement variant dans le temps où chaque étape s'analyse comme état courant fois une transition. Constituer l'équipe a exigé de faire dialoguer des théoriciens des systèmes dynamiques — un domaine centenaire — avec des bâtisseurs de puces qui ne parlaient historiquement pas le même langage, et de créer une bibliothèque Python qui permet d'exprimer des éléments variant dans le temps et stochastiques au lieu d'une interface à la CUDA.
La clôture élargit la focale aux implications. L'intelligence par watt est la métrique à optimiser vers un plafond thermodynamique infranchissable ; les cerveaux de mammifères s'en tiennent à un ou deux ordres tandis que l'informatique actuelle s'en trouve à environ dix milliards de fois. L'entreprise vise les limites de la lithographie bidimensionnelle d'ici trois ans et demi et, sur la prochaine décennie, à dépasser la biologie et à pousser le calcul vers de nombreux petits sites plutôt que quelques campus à gigawatts, avec des bénéfices revendiqués environnementaux, locaux et adaptatifs, plus des milliards de robots qui s'assemblent dynamiquement. Si la disruption atteint un changement de coût de mille fois, le paradoxe de Jevons invoqué suggère que la consommation augmentera de plus de mille fois, pouvant créer le plus grand marché jamais vu.
Moments clés
- Cadrage anti-catastrophe : l'IA comme prochaine évolution
Une IA présentée parmi les technologies les plus transformatrices.
- De la curiosité d'enfant au doctorat : premier ordinateur en 1978
Une fascination pour la programmation devenue neurosciences.
- De Nervana à MosaicML : première puce IA à Databricks
Un pari matériel de 2014 difficile à vendre jusqu'à 2023.
- Promesse : objectif mille fois avancé de cinq à trois ans et demi
Des problèmes profonds résolus plus vite grâce à l'IA.
- Mur énergétique : 3,2 quadrillions de tokens et 12 gigawatts chez Google
États-Unis 40 gigawatts, monde sous 100 gigawatts.
- Cerveau 20 watts, écureuil 8 milliwatts : preuve biologique
Un téléphone à 1 watt pour cent cerveaux d'écureuil en théorie.
- Pourquoi inefficace : cortex 16 milliards de bits, GPU 30 billions
Coût du déplacement d'information depuis Eniac.
- Moore ralenti : couper l'abstraction
Couper l'abstraction binaire et faire tourner la physique.
- Synchro métronome : intuition physique
Oscillateurs verrouillés sur planche rigide.
- Modèle UNO : image à oscillateurs et espace d'état
Trajectoires différentes avion, voiture, oiseau.
- Sparsité : moins de liens, meilleur entraînement
Triple gain contre mise à l'échelle quadratique.
- Premier ordinateur dynamique physique : puce sortie en juin
Premières images d'une puce conçue en cinq mois.
- 500 nanojoules : de millijoules à nanojoules
Ordres de grandeur sans convoyage d'information.
- Calcul 4D et feuille de route : rack en deux ans, librairie Python
Calcul et mémoire même chose et paradoxe de Jevons.
Commentaire de l’IA
"Ma lecture est simple : ce n'est pas une course aux modèles mais de l'intelligence par watt. Rao brandit la biologie comme preuve et propose de couper la pile d'abstractions numériques pour faire tourner la physique directement — radical sur le papier, mais un prototype est sur la table et les chiffres font passer le débat de la promesse à la mesure."
Évaluation de l’IA
À mon sens le coup le plus fort de la vidéo est aussi celui qui mérite la lecture la plus prudente : prendre la biologie comme preuve et la physique comme chemin. En le renforçant, si le déplacement d'information domine vraiment la facture énergétique et que le cerveau prouve qu'on peut le ramener près de zéro, alors couper la pile d'abstraction est un pari rationnel. L'équipe apporte d'ailleurs des preuves en deux temps — une simulation ouverte avec UNO puis une puce physique — de sorte que l'affirmation ne tient pas à une seule image. La contre-argumentation honnête est qu'un nouveau substrat remet à zéro des décennies d'optimisation empilées sur la pile logicielle existante, et un facteur mille ne veut pas dire grand-chose sans compter le coût d'écosystème.
Côté limites, trois points ressortent. D'abord, la projection énergétique s'appuie sur un seul fournisseur et une seule hypothèse, donc si 10 joules par token est optimiste le tableau s'assombrit, s'il est pessimiste il s'adoucit et le plafond à trois ans glisse. Ensuite, 500 nanojoules est un point unique mesuré sur un premier prototype pour une seule tâche ; combien survivra à la variance de fabrication, au rendement, au packaging et au déploiement à grande échelle reste à prouver sur le terrain. Enfin, la portabilité : une migration au niveau modèle est annoncée nécessaire, mais réinterpréter la multiplication matricielle comme comportement variant dans le temps laisse ouverte la question de ce qu'il faudra réécrire dans les frameworks, compilateurs et astuces pratiques comme la mise en cache des clés et valeurs, et le calendrier au-delà de l'objectif produit à deux ans reste flou.
Ma lecture pratique est de voir ceci non comme un lancement produit mais comme un jalon de programme de recherche. Pour les investisseurs la question n'est pas de croire ou non un facteur mille mais quels jalons sur le chemin de deux ans vers un rack le valideront : si la même efficacité se retrouve sur des modèles de langage, si la bibliothèque Python s'impose au-delà de l'équipe fondatrice, et si les gains sont mesurés au niveau système plutôt que puce seule. Pour les bâtisseurs le signal est de suivre l'intelligence par watt aux côtés des scores de modèles et de peser tôt le coût de portage si une option matérielle disruptive apparaît. Le prototype est enthousiasmant, mais dépasser la biologie se gagnera par des mesures système reproductibles, pas par une image de laboratoire.
Sources
6 liens ; aucun autre article publié ne les cite. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
- @youtube.com YouTube — All-In Podcast : Naveen Rao et l'informatique 4D
- @unconv.ai https://unconv.ai/blog/introducing-unconventional-ai/
- @thenextweb.com https://thenextweb.com/news/unconventional-ai-un0-oscillator-chip-image-generation-naveen-rao
- @techcrunch.com https://techcrunch.com/2025/10/03/sources-naveen-raos-new-ai-hardware-startup-targets-5b-valuation-with-backing-from-a16z/
- @hpcwire.com https://www.hpcwire.com/aiwire/2025/12/10/unconventional-ai-wants-to-solve-ai-scaling-crunch-with-analog-chips-will-it-work
- @theregister.com https://www.theregister.com/special-features/2025/12/08/bezos-backed-unconventional-ai-addresses-datacenter-power/2006862
calcul 4d · mur énergétique · oscillateur · cerveau d'écureuil · efficacité