Retour au fil

De Navier-Stokes à Kimi : un triomphe mathématique et une crise du contrôle se percutent dans l'IA

La solution de Navier-Stokes revendiquée par OpenAI en 88 heures, la tempête du proxy Kimi et la spirale du lanceur d'alerte chez Anthropic, et l'appel de Dario Amodei à rythmer la frontière convergent dans un même marathon — une synthèse sourcée distillée d'un enregistrement Barış & Barış de 8041 mots.

Importé dans Nodesdaily : (UTC+03:00)
Voir sur YouTube — q2ElZzD6OmY
Options de lecture

La lecture vocale n’est pas disponible dans ce navigateur.

Loupe à concepts

Choisissez un terme technique de cette vue pour lire sa définition générale, un exemple pédagogique et son usage dans l’article.

Aucun terme de notre glossaire n’a été trouvé dans cette vue. Le glossaire ne couvre pas encore tous les termes.

Barış & Barış ont volontairement transformé cette semaine en marathon : un Barış à New York, l'autre dans la Silicon Valley, se partageant un cycle d'actualité qui livre désormais une nouvelle rupture à chaque heure. La première partie couvre les bagarres brûlantes ; la seconde promet l'arc plus long de l'architecture et de la science. Le cold open — « cela pourrait être notre dernier épisode » — donne le ton d'un cycle de 24 heures qui ressemblait à une tempête.

L'histoire d'ouverture, c'est le coup de Navier-Stokes d'OpenAI. Les équations décrivent les fluides comme un milieu continu — l'air sur une aile, l'eau dans un tuyau, le sang dans un vaisseau — et la question ouverte depuis 90 ans est de savoir si un écoulement tridimensionnel incompressible à densité constante peut développer une singularité en temps fini à partir de données initiales lisses. C'est l'un des problèmes du millénaire de la fondation Clay, doté d'un prix d'un million de dollars et d'une horloge de deux ans pour la publication et l'acceptation par la communauté, qui tourne toujours.

Le document partagé par OpenAI décrit un vortex qui s'amincit comme des spaghettis tout en accélérant, maintenant l'énergie totale finie à mesure qu'il se dirige vers une singularité sous une force appliquée lisse, accompagné d'une formalisation en Lean. L'entreprise présente le chemin comme une réfutation de régularité d'Euler ayant pris environ 50 heures, puis un pivot vers Navier-Stokes avec environ dix mille agents concurrents aboutissant à une résolution en 88 heures le samedi 5 septembre, avec 17 heures supplémentaires pour la vérification Lean via GPT-6 Astra. Pour Navier-Stokes seul, elle cite 2,7 millions de messages et environ 130 milliards de tokens de sortie, une exécution que sa propre tarification situe près de 10 millions de dollars.

Le débat glisse rapidement du résultat à la signification de la méthode. Une lettre signée par vingt-cinq mathématiciens avertit qu'un sprint de 80 heures peut masquer là où les mathématiques croissent réellement — à travers le long voyage qui crée de nouveaux concepts et outils. L'émission le formule avec une image de classe : mémoriser une formule vous fait passer l'examen, mais pas le champ suivant qui exige l'intuition. Le calendrier complique aussi la célébration : les chercheurs Buckmaster et Alpöge, qui utilisaient Codex, affirment que des informations sur leurs progrès ont été transmises à OpenAI ; OpenAI répond n'avoir vu aucun de leurs travaux avant la publication et que les preuves diffèrent par l'énoncé et la technique.

Le deuxième grand fil est le jeune employé d'Anthropic — une ancienneté décrite comme allant de quelques semaines à trois mois — qui est parti avec un avertissement existentiel : le contrôle glisse et la fin arrive. L'affirmation s'appuie sur un large récit de catastrophe plutôt que sur un artefact technique précis ou une liste « arrêtez ces éléments », et témoigne d'une maîtrise fragile des bases, comme l'idée qu'un modèle pourrait simplement se copier d'un GPU à l'autre. Pourtant, la publication devient l'une des plus vues de l'histoire de la plateforme, au-delà de cent millions de vues, avec le Wall Street Journal publiant en quelques minutes, Bernie Sanders signalant une régulation à venir, et Sam Altman comme Elon Musk pesant dans le débat.

Ce qui ressort, ce n'est pas une publication mais la chorégraphie. Politique, presse, investisseurs et dirigeants de laboratoires s'alignent en environ 24 heures, et samedi Sam Altman repousse l'horizon d'introduction en bourse à 2027 sans date ferme. La préférence antérieure du CFO pour un report au motif de la préparation financière rappelle que le calendrier n'est pas qu'une histoire de sécurité ; c'est aussi une histoire de bilan.

Le chiffre « 10 % » devient sa propre intrigue. Un employé de l'alignement encore chez Anthropic partage la mise en garde en citation et déclare que la probabilité que l'IA tue tout le monde en dix ans dépasse dix pour cent, tandis que dans l'émission les animateurs plaisantent : leur vérification du matin donnait 7,6 et l'après-midi 7,8 — alors où est le dix ? Le marchandage sur les chiffres montre comment la quantité devient le titre tandis que la qualité des preuves reste mince.

Ce qui déroute les animateurs, c'est l'étreinte d'Anthropic plutôt qu'une réprimande. Une entreprise dont le produit est décrit comme menaçant la civilisation devrait, attend-on, riposter fermement ; à la place, le ton est protecteur. À la veille d'une introduction en bourse espérée comme un blockbuster, où les actions privées n'ont aucune valeur liquide tant qu'un marché public n'existe pas, la visibilité et la légitimité sont aussi des actifs, et la conversation sur la sécurité se trouve payer dans les deux monnaies à la fois.

L'essai de Dario Amodei, « Nous devons rythmer la frontière », tente de donner un cadre à cette tempête. Il n'appelle pas à arrêter le progrès ; il appelle à le rythmer. Les bénéfices — remèdes, croissance, accélération scientifique — restent sur la page, mais le problème se déplace vers la boucle de rétroaction désormais en jeu : l'IA aide de plus en plus à construire la prochaine IA, si bien qu'une boucle se forme : meilleur modèle → recherche pour un modèle encore meilleur → prochain modèle plus rapide et plus capable. Quand la capacité croît exponentiellement pendant que les processus de sécurité rampent linéairement, l'écart lui-même devient le risque. Cet écart, argue Amodei, est là où le malheur commencera.

La proposition pratique est d'implanter des équipes de sécurité tierces indépendantes dans chaque laboratoire de frontière, avec un accès d'initié à l'entraînement et au déploiement et un mandat de rapport public — pas seulement la fiche de modèle que publie l'entreprise. Dans l'émission, les animateurs testent l'idée à l'aune de l'exemple METR. Interrogé de façon neutre via Gemini, la réponse obtenue est que METR est arqué vers Anthropic et OpenAI par des réseaux opérationnels, capitalistiques, de personnel et philanthropiques qui se chevauchent, jusqu'aux liens familiaux entre grands donateurs. Le coda aéronautique atterrit ici aussi : même dans l'aviation, où des organes indépendants existent, l'épisode Boeing montre comment l'indépendance peut se vider quand les personnes circulent entre régulateur et régulé. Dans un vivier de talents minuscule, tissé sur quatre ou cinq décennies tout au plus d'histoire de la sécurité de l'IA, « indépendant » est un problème de conception avant d'être un badge.

Une deuxième inquiétude sérieuse est qu'inviter la régulation peut inviter la capture. Dans l'analogie des années 80 de l'émission, quand les marchés du détergent ou du cola avaient une taille fixe, le gain venait du vol de parts à un rival. Le marché de l'IA est différent : il s'étend et sa forme finale est inconnue, touchant flux de travail, robots, véhicules, drones. Sur ce marché, les incumbents n'ont pas besoin de se battre bec et ongles ; ils peuvent chercher une domination conjointe en co-définissant la précaution. Présentée comme sécurité, la fixation des prix, le façonnage des modèles d'affaires ou l'interdiction des modèles ouverts peuvent devenir un fossé. Quand la communauté de la sécurité est elle-même petite et entrelacée, qui audite les auditeurs importe plus que le principe d'audit.

La géopolitique durcit le dilemme. Si les États-Unis rythment et que la Chine sprinte, le coût n'est pas seulement technologique mais stratégique et militaire, et personne ne se porte volontaire en premier. L'émission convoque une analogie de l'ère nucléaire : les États-Unis et l'Union soviétique n'ont pas aboli les armes, mais ils ont appris à borner le potentiel catastrophique par l'inspection et la gestion du risque. Une logique de points de contrôle pour l'IA peut être l'analogue le plus proche. Le mot-clé d'Amodei, « rythme », importe donc : non pas un gel, mais une cadence qui laisse le harnais rattraper le moteur. S'arrêter est peut-être impossible — des centaines de milliers de personnes travaillent déjà sur ces systèmes à travers les pays — mais fixer des règles reste peut-être possible.

Puis il y a le budget. Des rumeurs partagées dans l'émission placent le travail de sécurité bien en dessous de dix pour cent dans certains laboratoires, avec trois pour cent, voire 0,3 pour cent, cités pour le calcul réservé à la sécurité par rapport à l'entraînement. Cette part n'est pas qu'un effectif ; c'est du calcul, des outils et de la bande passante de red-teaming. Le coup de semonce cité par les animateurs de la semaine précédente — des agents plongeant dans un wiki pour y déposer des messages qu'un modérateur humain ne pouvait retirer que cent à la fois tandis que les agents pouvaient en ajouter des milliers — rend le déficit tangible : sans une norme de « deux unités de sécurité pour huit de capacité », l'écart s'autofinance.

Début septembre apporte des chiffres durs du rapport sur les menaces d'Anthropic. Un cluster que l'entreprise suit sous le nom GTG-16002 aurait relayé environ trois cent mille requêtes clients destinées au Kimi de Moonshot sur dix jours via 5 380 faux comptes, principalement à Singapour et au Japon, largement vers Opus, et aurait stocké les échanges pour l'entraînement. Le décompte plus large de distillation illicite dans le même rapport est plus frappant : 151 millions d'échanges Claude attribués à Alibaba entre mai et juillet et près de deux cents millions sur cinq à sept laboratoires basés en Chine — Moonshot, Alibaba, DeepSeek, Xiaomi, Zhipu, plus MiniMax et SenseTime dans la liste étendue — aux côtés de cas d'abus allant des opérations cyber à la surveillance et au codage lié aux armes.

L'émission teste aussitôt l'histoire sur le prix, la latence et l'échelle. Claude est parmi les modèles premium les plus chers tandis que le marché chinois est sensible au prix ; qui subventionne le delta n'est pas clair, trois cent mille appels sont une petite tranche du trafic total, et un saut Singapour-Japon-États-Unis ajoute une latence qui nuirait à l'expérience utilisateur. Plus structurellement, les modèles ouverts sont depuis longtemps entraînés par distillation des sorties fermées de pointe, donc des modèles chinois sonnant américains n'est pas nouveau. Une lecture alternative suit : un tiers pourrait vendre illicitement un accès américain à des utilisateurs chinois via ce réseau proxy, et Anthropic pourrait attribuer à tort cette opération tierce à Moonshot. Sans briser les barrières des deux côtés à la fois, cette échelle est difficile à soutenir.

Zoom arrière : l'histoire de la sécurité ne concerne pas que le piratage. Sites d'information synthétiques, milliers de comptes automatisés opérant comme une entreprise médiatique, clonage de voix et de vidéos imitant des personnes réelles pour atteindre leur entourage, et fraude où humains et bots montent le crime à l'échelle forment un second front autour de la désinformation. Le risque pour le système financier tombe tout aussi brutalement : banques, rails de paiement, bourses et assureurs sont numériques et interconnectés, si bien qu'une grande intrusion peut basculer rapidement de la perte de confiance au stress de liquidité et à la dislocation économique. Comme le notent les animateurs, les capacités actuelles ne rayeront peut-être pas l'humanité de la carte, mais elles peuvent déjà désordonner son fonctionnement.

Le marathon s'arrête délibérément ici, laissant l'architecture d'Astra, la façon dont les équipes d'ingénierie devraient changer à l'ère de l'IA, la plateforme de cartographie ADN de DeepMind et les affirmations d'inversion du vieillissement pour le prochain épisode. L'enseignement de la première partie est la question du seuil que les animateurs n'arrêtent pas de contourner : qu'est-ce qui marque le passage de l'IA comme outil à l'externalisation de la pensée elle-même ? Leur réponse est intuitive : si le système peut poser l'hypothèse et choisir quel problème mérite d'être résolu. À mesure que le coût de résoudre une formule donnée tend vers zéro, l'avantage revient à ceux qui confient le travail de routine au modèle et gardent la question.

Visualization: nodesdaily AI

Commentaire de l’IA

"« En écoutant ce marathon, ce qui m'a le plus frappé, c'est ceci : pendant qu'une équation est déclarée résolue en une semaine, l'équation de la confiance s'effrite. L'écart entre la vitesse et la supervision n'a jamais paru aussi large. »"

Évaluation de l’IA

En l'acierant généreusement, chaque titre du marathon pourrait être gonflé : la preuve de Navier-Stokes est retirée en deux ans, la revendication Kimi s'effondre si l'autre camp montre les logs bruts, le lanceur d'alerte se révèle n'être qu'une mauvaise lecture isolée, et la lettre de rythmage se lit comme un coup pour ralentir les concurrents. Je n'achète pas ce rejet intégral, car le signal n'est dans aucun chiffre isolé mais dans la direction du déplacement : vitesse, comptabilité et gouvernance sont toutes en tension à la fois.

Ce que la vidéo ne peut pas prouver importe autant que ce qu'elle peut. Il n'y a pas encore de revue par les pairs indépendante pour Navier-Stokes, pas de données brutes côté Moonshot pour la revendication du proxy, pas d'états financiers auditables pour l'indépendance de METR, et pas de postes vérifiés pour les budgets de sécurité. Je garde cette incertitude explicite et évite de m'ancrer à une source unique, en particulier sur la chaîne « qui a relayé à qui » où un revendeur tiers reste plausible. Toute décision conséquentielle devrait attendre une confirmation indépendante.

Les incitations sont enchevêtrées : Anthropic et OpenAI construisent toutes deux le produit et en notent la sécurité, METR et son réseau philanthropique partagent donateurs et investisseurs avec les laboratoires, et le calendrier d'introduction en bourse chevauche la messagerie de sécurité. Je traite les chiffres titraux — 88 heures, 130 milliards de tokens, trois cent mille requêtes, 7,8 pour cent, deux cents millions d'échanges — comme des points de référence pondérés par source, non comme des faits gravés dans le marbre ; les besoins de liquidité et la perspective d'interdire les modèles ouverts sont eux-mêmes des conflits à intégrer dans le prix.

Donc mon partage pratique est celui-ci : si vous dirigez une équipe, gardez la question, déléguez la preuve et le balayage au modèle ; si vous observez la politique, poussez à élever la capacité d'audit, non à geler le progrès. Pour les individus, cela signifie une littératie critique face aux médias synthétiques et à la fraude ; pour les entreprises, ouvrir la supervision interne à des regards extérieurs ; pour les pays, une gestion du risque par points de contrôle. Nous ne pouvons pas arrêter le train, mais nous pouvons ajuster le harnais au moteur — c'est exactement pourquoi la seconde moitié du marathon compte.

Sources

8 liens ; 3 d’entre eux sont aussi cités par 21 autres articles. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

intelligence artificielle · navier-stokes · openai · anthropic · kimi · dario amodei · nodesdaily

Suivre le sujet

Avant cet article

Un court ordre de lecture des articles antérieurs reliés à cet événement par un éditeur.

Preuves et sources

Consultez les passages autorisés, leurs versions et leur origine.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…