Retour au fil

Le pari de Google sur l'IA incarnée : Gemini Robotics 2 et la course à l'AGI physique

Avec Gemini Robotics 2, Google veut donner un corps à l'IA grâce à une pile en trois couches qui raisonne, convertit la pensée en mouvement et tourne sur la machine même ; mais les scores de dextérité et le problème de la généralisation montrent que la route vers l'AGI physique ne fait que commencer.

Importé dans Nodesdaily : (UTC+03:00)
Voir sur YouTube — L1yZ7TILj68
Options de lecture

La lecture vocale n’est pas disponible dans ce navigateur.

Loupe à concepts

Choisissez un terme technique de cette vue pour lire sa définition générale, un exemple pédagogique et son usage dans l’article.

Aucun terme de notre glossaire n’a été trouvé dans cette vue. Le glossaire ne couvre pas encore tous les termes.

Depuis plus d'une décennie, une vitre invisible nous séparait de l'intelligence artificielle : elle écrivait, voyait, résolvait, mais ne touchait rien. Google tente désormais de briser cette vitre. Le système nommé Gemini Robotics 2 vise l' intelligence incarnée ; non pas un esprit qui décrit le monde à distance, mais un esprit qui agit en son sein.

Pensez à votre café du matin : la main cherche l'anse, les doigts se referment, la prise s'ajuste au poids. Nul calcul de distance, nulle pesée des forces contre la céramique ; le cerveau règle des années d'expérience sous la conscience. Demandez le même geste à un robot et le tableau change : trouver la tasse, choisir l'anse, tenir l'angle, doser la force, compenser le poids, garder l'équilibre tout au long du transport. Chaque étape dépend de faits qui peuvent différer de l'essai précédent ; la table peut pencher, la tasse être pleine, quelqu'un traverser. Un modèle de langage peut raisonner sur une tasse, mais le robot doit convertir ce raisonnement en force, mouvement, équilibre, rythme et contact.

Le robot d'usine échappe à la plupart de ces tracas car l'environnement est arrangé autour de la machine ; il répète le même geste au même point des milliers de fois. L'humanoïde travaille dans un monde bâti pour l'humain : poignées à hauteur d'homme, étagères à portée de main, escaliers pour deux jambes. La thèse de l'orateur se précise ici : plutôt que des spécialistes à tâche unique, le robot généraliste capable de métiers variés créera davantage de valeur ; les machines de spectacle qui courent et sautent sont la vitrine, pas l'épreuve.

Une pile d'intelligence en trois couches

Côté DeepMind, l'architecture repose sur trois pièces. Au centre, le modèle d'action : il prend l'image caméra plus l'instruction en langage et les convertit en mouvement. Au-dessus, la couche de raisonnement nommée ER2 lit la scène, découpe le travail en étapes, suit le progrès et révise le plan quand le réel désobéit. En bas tourne une version qui vit directement sur la machine, supprimant l'aller-retour vers un serveur lointain. Comme le confirment les pages produit de DeepMind, ce modèle embarqué s'adapte à un corps nouveau en quelques heures et avec moins de 200 exemples. Vue d'ensemble, une pile apparaît : saisir la scène, décider, convertir la décision en mouvement, l'exécuter localement.

L'esprit de cette pile se voit au mieux dans la scène du garage à ranger. L'utilisateur veut un garage en désordre nettoyé et les outils rendus à leur boîte ; le système saisit ensemble le gant de frottage et le flacon pulvérisateur, puis les porte au bac transparent le plus à droite sur l'étagère haute. Le modèle supérieur résout quoi faire, où aller et la question la plus dure : quand la tâche compte pour finie. La capacité que DeepMind documente comme suivi du succès signifie que le robot sait s'il doit réessayer ou s'arrêter ; en configuration multi-robots, les machines reconnaissent leurs forces mutuelles et se partagent le travail.

L'intelligence corps entier et l'essai Apollo

Google éprouve cet esprit sur Apollo 2, plateforme humanoïde construite par Apptronik. L'instruction est simple : porter l'arrosoir au bac vert de l'étagère basse. Pourtant marcher dépasse le balancement de deux jambes ; chaque pas déplace le centre de masse, chaque extension trouble l'équilibre, chaque objet saisi change les forces sur le corps. Dans la conception d'Apptronik, jambes, torse, bras et mains doivent oeuvrer comme un système coordonné unique ; la société nomme exactement cela l' intelligence corps entier . La démonstration réussit, avec une note honnête : la machine bouge plus lentement et moins fluidement qu'une personne ; le faire une fois est un spectacle, le faire vite et chaque fois est un produit.

Le goulet de la dextérité

Le vrai fossé s'ouvre aux doigts. Une main humaine tient un oeuf sans l'écraser, tourne un bouchon, noue un noeud, sent l'instant du contact et corrige la prise avant le glissement. La main à cinq doigts montée sur Apollo 2 offre 22 degrés de liberté ; la probabilité d'échec croît avec la souplesse. Les évaluations de Google chiffrent le tableau : dévisser une ampoule réussit à 92 %, mais la revisser tombe à 36 % ; nouer un sac poubelle atteint 44 %, balayer vers la pelle 32 %, fermer un sachet à zip environ 40 %. Pour l'humain, poser une ampoule est un geste quasi certain ; pour le robot, un coup de dés. La marche applaudit peut-être, mais le toucher quotidien est le véritable examen de l'intelligence physique.

Le transfert entre corps

La seconde épreuve de la promesse généraliste est de savoir si l'intelligence peut se détacher du corps. Chaque plateforme diffère par articulations, capteurs, proportions et limites ; porter un savoir-faire d'un bras vers un humanoïde ressemble à exécuter d'une autre main ce qui fut appris autrement. Google répond en faisant tourner la même copie du modèle sur trois corps distincts : des versions d'Apollo 2 aux mains différentes et un montage à deux bras avec pince. L'adaptation du modèle embarqué à un corps neuf en quelques heures et peu d'exemples change l'économie : si nulle machine n'exige des mois d'entraînement spécial, une intelligence unique peut se déployer sur des corps variés selon les tâches. L'horizon est une couche d'intelligence extensible qui survit au changement de matériel.

Pourtant un modèle ne généralise qu'autant que son expérience, et l'expérience physique coûte cher. Les modèles de langage disposaient d'internet ; des milliards de pages se copiaient numériquement. Le robot n'a nul raccourci pareil : il ne peut apprendre le toucher d'une serviette en lisant, ni la force d'un tiroir par description. Quatre sources sont comptées : la téléopération où l'humain pilote la machine à distance, les vidéos enregistrant les gens au travail, la simulation offrant des millions de répétitions en salles virtuelles, et les données que le robot collecte lui-même sur le terrain. Nulle ne couvre seule les combinaisons de lumière, surface, objet, humain et panne que sert le monde physique.

La course aux données et Robot Park

La course humanoïde devient ainsi une course au trésor d'expérience physique. Figure, avec Brookfield, bâtit un réseau de données couvrant plus de 100 000 logements et des centaines de millions de mètres carrés de bureaux et de logistique ; son modèle Helix apprend la navigation purement depuis des enregistrements de caméras portées par des humains, et s'oriente en pièces réelles sans démonstration robotique. Selon les rapports de Figure, le transfert sans exemple de la vidéo humaine vers la navigation robotique se montre pour la première fois. L'actif précieux n'est plus le robot lui-même ; c'est le vivier d'expérience né entre les robots et les humains alentour.

Google et Apptronik choisissent de fabriquer l'expérience comme en usine. Selon l'annonce d'Apptronik, le Robot Park agrandi à Austin le 30 juin 2026 fait travailler des flottes d'Apollo 2 aux tâches de logistique, de fabrication et de commerce sur près de 90 000 pieds carrés, avec des sites clients tels que Mercedes-Benz et GXO dans le réseau. Chaque prise réussie devient un échantillon d'entraînement, chaque essai manqué un autre ; même un passant devient donnée. De là naît la boucle de données : les robots produisent des données, les données améliorent les modèles, les modèles meilleurs entrent en plus de lieux et rapportent plus de données. Le déploiement devient partie de l'entraînement.

Généralisation et travail programmable

La boucle ne tourne que si l'expérience se convertit en savoir réutilisable ; répéter un signal faible un million de fois ne donne nul bon modèle. Une prise qui chante dans un entrepôt peut casser quand la lumière change ; une main qui tient une boîte sèche glisse sur surface humide ; un geste sûr sans personne alentour devient risqué quand un humain s'approche. Le système doit apprendre des motifs au lieu de mémoriser, et raisonner sur des scènes jamais vues. Les camps rivaux attaquent la même question par des flancs distincts : la robotique Gemini de Google, Helix de Figure, la plateforme GR00T de Nvidia et l'équipe Physical Intelligence ; les architectures diffèrent, la question est une : comment l'expérience physique devient-elle intelligence réutilisable ?

La couche ER2 tente une réponse collective : découper la tâche et la distribuer entre robots. L'un se tient bien placé pour soulever, l'autre proche de la cible, un troisième prend un morceau différent ; l'esprit supérieur fixe la division du labeur. Tandis qu'un robot seul occupe un point unique, une équipe partage espace et effort, couvrant le membre qui cale. La difficulté est la coordination sous incertitude : deux robots en harmonie dans un hall contrôlé ne prouvent rien de centaines travaillant seuls dans un dépôt chaotique. Espace disputé, matériel en panne, plan qui s'effondre à mi-course ; l'intelligence partagée doit faire confiance au raisonnement, non aux scripts figés, en ces instants.

Le cadre économique bascule ici aussi : la question n'est pas les métiers pris en bloc, mais les tâches devenant programmables une à une. La marche, la prise, le port, le tri, le scan, le contrôle et le chargement d'un poste franchissent le seuil séparément. Une machine qui pose une ampoule à 36 % ne peut rejoindre une ligne de production ; une machine plus lente que l'humain reste coûteuse en la plupart des tâches. Le proche avenir ne tient nuls millions d'humanoïdes remplaçant les ouvriers, mais un élargissement graduel du vivier de tâches valant automatisation ; la frontière recule à chaque gain.

Sécurité : savoir quand ne pas agir

Quand le logiciel se trompe, le résultat finit au rebut ; quand une machine physique se trompe, les biens cassent et les gens se blessent. La compétence la plus critique du système peut donc être de savoir s'arrêter : dire ce qu'il voit, où se tient son corps, distinguer objets et humains, juger ce qui est dangereux et quand appeler à l'aide. Google sonde ce front avec les repères ASIMOV ; la première version, présentée à CoRL 2025, générait automatiquement des constitutions de robots et portait l'alignement des comportements à 84,3 %, publiée ouvertement via GitHub. La seconde version teste la perception du danger physique, et la version agentique note le refus des tâches dangereuses, l'arrêt aux instants critiques et la consultation des humains. La vision finale s'attache à ce seuil : sur la route de l'AGI physique, la question n'est plus de savoir si la machine analyse l'ordre de saisir la tasse ; c'est de savoir où se tient la tasse, combien elle peut être fragile, qui se tient près et que faire quand le plan échoue. Dès que l'intelligence gagne un corps, le monde lui-même rejoint l'examen.

Visualization: nodesdaily AI

Moments clés

  1. La thèse de la vitre
  2. L'exemple de la tasse de café
  3. Présentation de l'architecture en couches
  4. Démo Apollo 2 et arrosoir
  5. Les scores de dextérité
  6. Robot Park et boucle de données
  7. Le repère de sûreté ASIMOV

Commentaire de l’IA

"L'orateur raconte la feuille de route de Google comme une histoire d'architecture convaincante, mais les scores de dextérité trahissent une machine encore apprentie. Le front à surveiller n'est pas les démos ; c'est la vitesse à laquelle les données de terrain deviennent des modèles."

Évaluation de l’IA

L'objection la plus forte est que le récit de la boucle de données tourne trop rond. Amasser des données de terrain seules ne produit nulle généralisation ; les journaux de téléopération portent les habitudes de l'opérateur, et les simulations les hypothèses de leur moteur physique. Côté Figure, le transfert de navigation depuis la vidéo humaine impressionne, mais marcher et saisir sont des peines distinctes ; dans les travaux riches en contact comme tenir, tordre et sentir, le signal de la vidéo humaine faiblit. Ainsi l'échelle des données croît sans que la richesse du contact suive, et la boucle peut ralentir.

Les blancs de la présentation ressortent aussi. La consommation d'énergie, le coût horaire d'exploitation et le facteur de lenteur face à l'humain n'atteignent jamais les chiffres. Côté Apptronik, les dimensions d'Apollo 2 restent inédites, donc coller les chiffres de la première génération d'Apollo sur la machine neuve induirait en erreur. Côté sûreté, les repères ASIMOV tournent en scènes de laboratoire ; éprouver des centaines de robots à la fois dans un dépôt bondé est un problème d'échelle d'un autre ordre.

Le cadre de l'orateur orbite autour de Google et DeepMind ; les approches rivales n'ont droit qu'à un bref défilé. La plateforme GR00T de Nvidia, le modèle Helix de Figure et l'équipe Physical Intelligence se nomment en passant ; pourtant leurs stratégies de données diffèrent à la racine. Le partenariat Apptronik et l'éloge de Robot Park sonnent aussi à sens unique ; nulle source indépendante n'audite la qualité des données de terrain. Rien de tout cela ne rend le récit faux, mais cela marque son axe : non pas un panorama du secteur, une défense de la feuille de route de Google.

Le point pratique pour les lecteurs est net : les humanoïdes prendront des tâches isolées avant les métiers. Un réassort de rayon, un port de caisse ou un simple rangement s'automatisent dès le seuil de fiabilité franchi ; nulle décision d'investissement ne devrait précéder ce passage. Trois mesures méritent suivi : les taux de succès en essais répétés, le coût d'ajustement à un corps neuf et la vitesse de conversion des données de terrain en mises à jour du modèle. Tout pilote acheté avant leurs progrès reste un spectacle coûteux.

Sources

6 liens ; aucun autre article publié ne les cite. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

intelligence artificielle · robotique · google deepmind · robot humanoïde · automatisation

Suivre le sujet

Avant cet article

Un court ordre de lecture des articles antérieurs reliés à cet événement par un éditeur.

Preuves et sources

Consultez les passages autorisés, leurs versions et leur origine.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…