Au printemps 2026 Anthropic a ouvert un nouveau laboratoire sciences de la vie pour tester une question ambitieuse : un modèle de langage généraliste peut-il lire le génome sans être spécialiste. La première réponse est un système baptisé ART, pour RT associé à un réseau de répétitions. À l'image des étranges répétitions qui ont révélé CRISPR chez les bactéries, ART est apparu dans un jumbo phage, un virus de bactérie au génome exceptionnellement vaste. Le gène RT lui-même avait déjà été repéré, mais le réseau de séquences non codantes qui l'entoure et la protéine accessoire voisine, de fonction inconnue, n'avaient jamais été reconnus comme un ensemble cohérent.
Pour comprendre l'enjeu, imaginez l'ADN comme un plan maître verrouillé dans un coffre. Quand la cellule doit fabriquer une protéine, elle ne sort pas l'original, elle en fait une photocopie appelée ARN. Une enzyme de copie fabrique cette copie. Une RT fait l'inverse : elle reprend la photocopie ARN et la réécrit en ADN pour la recoller dans le plan. C'est ce pas en arrière qui donne aux rétrovirus leur nom. ART est une petite machine construite autour de cette écriture inverse, et son contexte suggère un éditeur programmable plutôt qu'une enzyme isolée.
L'histoire de ces éditeurs est une suite d'anomalies remarquées. Les enzymes de restriction qui coupent à des motifs courts dans les défenses bactériennes sont devenues les premiers ciseaux à ADN et ont lancé la biotechnologie. Une copieuse d'ADN tolérante à la chaleur issue d'une bactérie de Yellowstone a rendu possible la PCR. Plus tard, les répétitions groupées appelées CRISPR ont livré les ciseaux Cas9 et une vague de médecines d'édition, y compris des modèles animaux lumineux démontrant l'insertion précise. Chaque saut a suivi le même schéma : une machine programmable naturelle a été reconnue puis détournée. ART est présenté comme candidat à rejoindre cette famille car il porte l'ensemble de traits trouvé ensemble uniquement dans une poignée de systèmes programmables qui coupent, copient et collent l'ADN.
Sans les retrons, l'indice reste incomplet. Décrits en 1984, les retrons sont une défense bactérienne contre les phages qui fonctionne comme une grenade à goupille. La bactérie fabrique une protéine toxique avec goupille en place. Quand l'ADN du phage s'approche, la goupille saute et la grenade explose, sacrifiant la cellule infectée pour stopper le virus. C'est un front de la guerre microscopique menée chaque seconde. Ce que Claude semble avoir trouvé est la version miroir côté phage : une fois qu'un jumbo phage colonise une bactérie, il pose ses propres fils pièges pour tenir les virus concurrents à distance, une revendication territoriale écrite en ADN.
Le jumbo phage lui-même compte. Jumbo signifie que son génome est anormalement grand, comme un randonneur avec un sac plus grand que lui, transportant une large boîte à outils. Dans ce génome encombré, Claude a lié trois pièces : le gène RT, un réseau en tandem de répétitions en amont, et une protéine accessoire voisine sans rôle assigné. Prises isolément chaque pièce est banale, ensemble elles forment une signature qui jusqu'ici n'est apparue que dans des systèmes révélés programmables. C'est l'analogie du moteur de la vidéo : on ne trouve pas tous les moteurs en cherchant celui que l'on connaît, mais on reconnaît un moteur à la façon dont ses pièces s'assemblent.
Comment la trouvaille a été faite compte autant que la trouvaille elle-même. Environ 950 agents ont tourné pendant 21 heures sur un corpus d'ADN, dépensant près de 210 millions de jetons. Un agent, au lieu de lancer un autre script, a chargé un segment de lettres dans sa fenêtre de contexte et l'a lu lettre par lettre, C, A, T, G, T, G, pesant s'il ressemblait plutôt à un mini-réseau de type CRISPR ou à une répétition de type retron. Son raisonnement privé cite les travaux du laboratoire Jang 2024 et les pionniers CRISPR, tentant de nommer le motif avant de conclure à un réseau de répétitions en tandem. L'équipe note un résultat contre-intuitif : donner au modèle plus d'outils et plus d'informations pré-filtrées a dégradé sa capacité à décrire le réseau, tandis que la lecture lettre par lettre a réussi.
Anthropic relie cela à des travaux d'interprétabilité sur son grand modèle à accès contrôlé Mythos 5. Des signaux internes de Mythos 5 ont réagi au réseau de répétitions d'une façon qui ressemble aux modèles de génomique entraînés uniquement sur des séquences biologiques ayant appris des représentations des répétitions d'ADN. Le rapport fait l'analogie d'une étude sur jeu de cartes où la conductance de la peau des participants montait sur une mauvaise carte avant qu'ils puissent dire pourquoi elle était mauvaise. Chez Claude le pic d'activation a précédé l'étiquette en langage naturel. L'implication n'est pas mystique mais un sous-produit : un modèle général entraîné sur des données vastes semble avoir développé, comme capacité émergente, une représentation des répétitions en tandem qui recoupe celle d'un modèle spécialiste.
La découverte n'est pas restée in silico. Anthropic a construit un laboratoire humide pour que les hypothèses produites par les agents puissent être testées de bout en bout par des scientifiques sous le même toit, agents et humains collaborant à chaque étape. L'article sur ART partagé en preprint par Yoon et collègues en 2026 est la première sortie publique de cette boucle, et il n'est pas encore relu par les pairs. Feng Zhang, professeur au MIT et au Broad, pionnier de l'édition par CRISPR, l'a qualifié d'exemple enthousiasmant de contribution d'agents IA à la découverte biologique, en soulignant que les réseaux ARN-répétitions liés à cette famille RT méritent un suivi rigoureux.
Les chiffres invitent à une expérience de pensée simple. Le balayage coûterait à un utilisateur externe de l'ordre de 1 000 à 5 000 dollars aux tarifs d'API actuels, alors que le marché de l'édition CRISPR qu'il évoque est souvent estimé autour de 6 milliards de dollars à l'échelle mondiale en 2026. Dans la vidéo c'est cadré comme une machine d'arcade pour la science : on alimente en calcul et en données, on accélère les prochaines années de découverte. Que la métaphore tienne dépendra du taux de succès à travers l'océan génomique, mais l'ancre de coût compte car même un signal à un sur cent, si peu cher à exécuter et parallélisable, change l'économie de la biologie exploratoire.
Jensen Huang, fondateur de Nvidia, l'a cadré de façon similaire cette semaine comme un passage de la découverte à l'ingénierie dans les sciences de la vie. La promesse partagée de CRISPR, des retrons et désormais d'ART est la programmabilité : donner un court guide, dire à la machine où agir, et elle coupe ou colle à cette adresse. Une analogie utile est un petit robot qui suit des coordonnées. La programmabilité d'ART n'est pas encore démontrée, ce qui l'est est la signature qui a prédit la programmabilité ailleurs, raison pour laquelle l'équipe soutient que le système mérite d'être priorisé pour une caractérisation biochimique.
Il y a un argument plus large sur l'usage des outils. Le débat récent a opposé modèles de langage et modèles plus outils, des critiques dévaluant les gains assistés par outils. Ce cas inverse l'histoire : la trace gagnante a utilisé moins d'outils algorithmiques et plus de raisonnement en contexte, lisant l'ADN comme texte. Cela ne prouve pas que les outils sont inutiles, cela suggère que pour des tâches d'intuition de motif la capacité du modèle à tenir une séquence en mémoire de travail et à raisonner lettre par lettre peut surpasser la recherche en pipeline. Le flux du laboratoire reflète cette vision, associant échafaudage et moments où l'on demande au modèle de simplement regarder.
Chaque éditeur puissant rappelle aussi le double usage. Un phage posant des défenses dans une bactérie est, en termes écologiques, une revendication biologique jalonnée d'armes qui tuent les virus concurrents. Détourner une telle machine tripartite pour l'usage humain serait transformer une architecture née comme arme en outil. La décision d'Anthropic de garder les modèles de classe Mythos derrière vérification et garde-fous entreprise est une part de cette reconnaissance : la même capacité qui trouve des éditeurs utiles peut faire émerger des architectures qui exigent une gouvernance avant diffusion large.
En prenant du recul, une seule signature cohérente dans un seul jumbo phage a peu de chance d'être la fin. Des millions de génomes de phages et de bactéries sont séquencés et en attente, et les recherches classiques de type contrôle-F échouent quand la même fonction est bâtie différemment. Ce que Claude a fait est de reconnaître une machine par ressemblance familiale plutôt que par séquence exacte. Si le travail en laboratoire humide confirme qu'ART peut être reprogrammé pour couper ou copier à des sites définis, la boîte à outils d'édition gagne une nouvelle clé. Sinon, la leçon demeure : un modèle général peut développer une intuition génomique utile pour systématiser la chasse aux machines naturelles, et cette systématisation elle-même pourrait être le moteur le plus conséquent.
Commentaire de l’IA
"Ce qui me frappe le plus, c'est l'équation coût-vitesse : une découverte tenue en une journée et quelques milliers de dollars, qui rappelle comment CRISPR est devenu une industrie à plusieurs milliards — sauf qu'ici le progrès vient d'une reconnaissance intuitive de la machine par ses pièces."
Évaluation de l’IA
L'argument le plus solide est qu'ART reste un candidat, pas encore un outil. L'article est un preprint sans démonstration de fonction couper-copier-coller, et la co-occurrence de trois traits prédit la programmabilité mais ne la prouve pas. Dans les histoires CRISPR et retron, des signatures similaires ont été suivies par des années de biochimie avant qu'un éditeur programmable n'émerge, pour ART il faudra des essais en laboratoire humide : la protéine accessoire se lie-t-elle aux répétitions, le réseau agit-il comme guide, et où la RT écrit-elle. Une lecture prudente traite donc la trouvaille comme un repère enthousiasmant sur la carte, non comme un instrument fini.
Deux limites méthodologiques ressortent. D'abord la reproductibilité : le fait que plus d'outils et plus de contexte pré-filtré aient dégradé le modèle suggère que la découverte pourrait dépendre d'un chemin de raisonnement fragile, et le taux de succès selon les graines n'est pas encore rapporté. Ensuite le choix du modèle : qu'un modèle général, non spécialiste de la génomique, ait fourni l'intuition est frappant, mais laisse ouverte la question pourquoi les modèles spécialistes l'ont manqué et si le signal interne de Mythos 5 est causal ou corrélatif. Sans réplications indépendantes en aveugle sur le même corpus, le taux de faux positifs reste inconnu.
Sur la vérification, le poids des preuves repose encore sur un preprint et un billet de blog Anthropic, non sur un article revu par les pairs avec données ouvertes et re-analyse indépendante. Les citations de Feng Zhang et Jensen Huang traduisent un optimisme prudent, pas une preuve. La liste de ce qui ferait changer d'avis est claire : les délétions du réseau de répétitions abolissent-elles la fonction, la RT montre-t-elle une écriture ARN vers ADN in vitro, et la protéine accessoire confère-t-elle ciblage ou stabilité. Une fois ces données publiques, la communauté pourra tester rapidement si des loci sœurs chez des jumbo phages apparentés portent la même architecture tripartite.
La portée pratique tient aux horizons temporels. À court terme, ART est un candidat prioritaire pour les laboratoires de recherche fondamentale et d'ingénierie des protéines, une traduction en outil clinique, si elle advient, demandera des années et des travaux de délivrance, spécificité et sûreté. L'économie des balayages bon marché est immédiatement exploitable : des runs de l'ordre de 1 000 à 5 000 dollars, parallélisés avec des agents, rendent même un faible taux de succès abordable pour la biologie exploratoire. Cela rend la métaphore de la machine d'arcade séduisante, mais rend aussi la gouvernance essentielle, la trouvaille se cadrant mieux comme hypothèse à tester et architecture à partager de façon responsable, non comme produit.
Sources
7 liens ; 3 d’entre eux sont aussi cités par 2 autres articles. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
- @youtube.com YouTube — Wes Roth : Claude et la machine ADN cachée
- @anthropic.com https://www.anthropic.com/news/claude-discovers-novel-enzyme-system
Également cité par : The Week Claude Ran a Quarter of Anthropic's Own Research: Inside the Labs
- @anthropic.com https://www-cdn.anthropic.com/22573675ada52a8ca8a97a1a4b4326b2f208a071.pdf
Également cité par : The Week Claude Ran a Quarter of Anthropic's Own Research: Inside the Labs
- @nature.com https://www.nature.com/articles/s41587-025-02879-3
- @ncbi.nlm.nih.gov https://www.ncbi.nlm.nih.gov/books/NBK19424/
- @mordorintelligence.com https://www.mordorintelligence.com/industry-reports/crispr-based-gene-editing-market
- @darioamodei.com https://darioamodei.com/essay/machines-of-loving-grace
Également cité par : Kokotajilo Warning: Superintelligence Could Take Jobs First, Political Power Next
ia · claude · anthropic · génomique · crispr · rt · retron