Retour au fil

Agents utilisateurs de robots : pourquoi les modèles généralistes gagnent le contrôle

Sur la scène Y Combinator, les fondateurs de Waddle Labs et RoboCurve décrivent l'ère où les modèles généralistes pilotent les bras robotiques par le code, de la thèse Isola à la démo du cube.

Importé dans Nodesdaily : (UTC+03:00)
Voir sur YouTube — Jv5B5CEaPJI
Options de lecture

La lecture vocale n’est pas disponible dans ce navigateur.

Loupe à concepts

Choisissez un terme technique de cette vue pour lire sa définition générale, un exemple pédagogique et son usage dans l’article.

Aucun terme de notre glossaire n’a été trouvé dans cette vue. Le glossaire ne couvre pas encore tous les termes.

La généralisation inattendue des agents codeurs compte parmi les plus grandes surprises récentes. Entraînés sur des millions de lignes de code, ces modèles ont acquis une discipline qui déborde vers des domaines inédits. Ce bond atteint désormais les bras robotiques, et les modèles généralistes pilotent des corps variés avec un seul langage. Pour la première fois, la règle d'un cerveau par corps vacille sérieusement.

La thèse Isola et le marionnettiste en nuage

Le chercheur du MIT Phillip Isola nomme cette rupture dans son essai du 7 septembre 2026. Un modèle de langage, dit-il, peut utiliser un robot comme un outil, comme une calculatrice ou un ordinateur. Selon le MIT, chaque robot connecté devient une main potentielle pour des modèles comme Fable et Astra. Dans cette vision, l'intelligence reste en nuage, le logiciel du corps ne change pas et les mises à jour arrivent par radio.

Les fondateurs de Waddle Labs, Jaime et Vincent, veulent prouver cela sur du matériel réel. L'équipe construit une couche d'exécution pour que les grands modèles pilotent efficacement, collecte des données et entraîne de meilleurs modèles. Selon waddlelabs.ai, l'agent découpe l'objectif en sous-tâches, observe les caméras, écrit du code de contrôle et appelle des modèles d'action prêts comme outils. L'ambition est de démarrer sans collecter de données neuves pour chaque bras ou pince.

Le côté RoboCurve maintient l'honnêteté par la mesure. Le cofondateur Jay dit tester bras, pinces, humanoïdes et quadrupèdes avec la même rigueur. Selon robocurve.org, l'entreprise d'utilité publique soutenue par Y Combinator publie les capacités frontières. Son cadre ouvert Inspect Robots veut remplacer les démos triées par une mesure continue et standardisée.

De courts clips devenus viraux ont attisé le débat. On y voit un grand modèle desserrer un couvercle, deux robots se partager le travail et un bras ouvrir un stylo. Selon The Decoder, le nouveau test StationeryBench a durci le constat : sur 200 essais avec des YAM à deux bras, Astra termine 7 tâches sur 100 et le rival zéro. Le score médian de 46 contre 12 rend le saut spatial mesurable.

RT2, action directe et écart de réflexion

Google DeepMind présenta RT2 en 2023 comme première étape sérieuse, et sa limite éclaire le changement. Selon DeepMind, la base PaLI-X fut affinée sur des démonstrations de 13 robots pendant 17 mois près d'un comptoir. Au lieu d'anglais, le modèle émettait des positions d'organe terminal converties en commandes articulaires. Le pré-entraînement visuel et linguistique à l'échelle du web améliora nettement la généralisation. Mais le modèle devait agir en une passe, comme obligé d'imprimer le résultat final dans l'analogie GSM8K sans montrer le calcul, tandis que les agents actuels ouvrent un intervalle de chaîne de pensée , réfléchissent sur plusieurs tours puis émettent une commande, une souplesse décisive.

L'intuition rejoint la leçon amère : donnez autonomie et calcul, et bien des savoir-faire émergent seuls. Libérer un grand modèle de base coûte moins et porte plus loin que d'enfermer l'architecture dans des données robotiques. La lignée Google Research derrière Code as Policies vise le type de données pour cette raison. Selon les écrits research, des paires instruction-code en few-shot permettent de servir beaucoup de tâches avec des politiques en code modulaires.

Politiques en code et bibliothèques

Code as Policies, annoncé en novembre 2022 par Liang et Zeng, redéfinit la programmation robotique. Des primitives comme saisir, soulever et aller-à deviennent des fonctions Python que le modèle compose. Selon l'article arXiv 2209.07753, les modèles produisaient des séquences sensées du premier coup sans données robotiques neuves. Ce succès one-shot alluma les travaux d'agents suivants.

Voyager porta l'idée vers la fabrication d'outils dans Minecraft. L'agent part de fonctions Python, compile des fichiers comme francois.py pendant les parcours et les convertit en compétences appelables. L'apprentissage en contexte y brille car quelques exemples enseignent la routine. Mais ces essais montrèrent aussi sa non-monotonie : le succès oscille, sature après 20 à 40 exemples, et l'ajout passé une fenêtre pleine cesse d'aider.

D'où l'échelle de Francois : essais rapides en contexte, puis mémoire augmentée, adaptateurs LoRA de faible rang, et au sommet affinage complet ou renforcement. Une société aux données de conduite illimitées comme Tesla ne se contenterait jamais de méthodes en contexte. Compiler les traces état-action-récompense du jour en poids pendant une passe de type sommeil prolonge la tradition DreamCoder.

Démo matérielle et vérité de latence

En démonstration, l'agent Ashra saisit un cube et le dépose dans un bol avec les seules caméras. Le système avance par tours : les images arrivent, le modèle sort la prochaine pose d'organe terminal, le bras s'y rend. À ce niveau, le code ressemble moins à une politique complète qu'à une suite d'appels d'outils . Les répétitions déterministes comme l'approche se compilent, tandis que la détection d'objet et les contrôles d'échec gardent un modèle visuel dans la boucle.

L'écart entre la couche Waddle et l'usage direct d'Astra paraît dans l'économie et la vitesse. Réfléchir avec un modèle géant à chaque pas coûte cher et lent. L'équipe compile donc la première trace réussie en compétence rapide appelée ensuite. Selon OpenAI, Astra atteint 64.6 à Terminal-Bench Science, devant la ligne Fable 5.1, à coût inférieur d'environ un tiers. Si le doublement mensuel de vitesse continue, un contrôle quasi temps réel se discutera avant la fin d'année.

Représentation platonique et deux ans

Un autre soutien vient des sciences cognitives avec l'hypothèse de la représentation platonique. Les travaux de Huh et collègues au MIT montrent que les grands modèles visuels et langagiers mesurent les distances entre points de façon de plus en plus semblable. Si cette convergence tient, un grand modèle de langage porte déjà un fort modèle du monde. Faire croître la compréhension via le code et l'usage informatique bat alors l'enfermement robotique.

Les données candidates derrière le bond d'Astra collent : usage informatique plus scènes CAD et Blender. Tirer un curseur pour pivoter un objet enseigne le haut-bas et la gauche-droite comme concepts spatiaux. Les interfaces jadis modelées sur le monde physique au Xerox PARC instruisent désormais les robots en sens inverse. Des essais façon Princeton en robotique en nuage rapportent qu'une bonne liaison outil-curseur améliore visiblement les scores physiques.

La prévision finale est audacieuse : en deux ans, des robots généralistes exécutant tout ordre en langage naturel qu'un jeune habile ferait à la main. Ce serait un moment ChatGPT pour la robotique. Les intervenants eux-mêmes préviennent des nœuds durs : latence, vérification de sûreté et élagage d'une bibliothèque croissante. La direction reste fixée : diversifier les données, laisser l'agent coder, garder la mesure ouverte et compiler les répétitions en vitesse.

Visualization: nodesdaily AI

Moments clés

  1. Ouverture : la surprise des agents codeurs
  2. Thèse Isola : le marionnettiste en nuage
  3. Démos virales : couvercles et stylos
  4. RT2 : des données web à l'action
  5. Code as Policies : code du premier coup
  6. Limites de l'apprentissage en contexte
  7. Ashra transporte le cube
  8. Représentation platonique et pari à deux ans

Commentaire de l’IA

"L'enthousiasme des fondateurs est contagieux, mais l'insistance de RoboCurve sur la mesure le rend honnête. Cette discussion a de la valeur parce qu'elle déplace le débat robotique vers les données et l'ingénierie."

Évaluation de l’IA

Le contre-argument le plus fort reste la latence et le contrôle temps réel. Les ateliers exigent des réactions en millisecondes alors que les grands modèles réfléchissent encore en secondes par tour. Les petites politiques embarquées comblent ce vide aujourd'hui, et l'essentiel du capital y va toujours. Sans inflexion des courbes de latence et de coût, la vision du marionnettiste ne se généralise pas.

Il manque un cadre de sûreté et de responsabilité. Une routine de saisie mal écrite peut casser un matériel coûteux ou blesser une personne. La conversation évoque la détection d'échec et la replanification, mais jamais une couche formelle de vérification. Les scènes désordonnées comme les sols mouillés, les ateliers encombrés et les foyers chargés restent sous-testées.

Les incitations des intervenants sont visibles : Waddle Labs vend une infrastructure d'agents et RoboCurve vend de la crédibilité par la mesure. Tous deux profitent de la vague des modèles généralistes et d'un calendrier optimiste. Cela n'invalide pas les données, mais la prévision de robots généralistes à deux ans mérite une décote.

Le conseil pratique est de ne pas verrouiller l'investissement robot sur un seul corps. Les équipes qui testent politiques spécialistes et agents en nuage sur le même bras apprennent le plus vite. Pour les petites équipes, le départ le moins cher consiste à confier une saisie aux caméras existantes et à verser les échecs dans une bibliothèque de compétences. Ceux qui instrumentent la mesure en premier verront en premier quels emplois sont vraiment automatisés.

Sources

9 liens ; 1 d’entre eux sont aussi cités par 17 autres articles. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

agents robotiques · llm · waddle labs · robocurve · code as policies

Suivre le sujet

Avant cet article

Un court ordre de lecture des articles antérieurs reliés à cet événement par un éditeur.

Preuves et sources

Consultez les passages autorisés, leurs versions et leur origine.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…