Durante más de una década, un cristal invisible nos separó de la inteligencia artificial: escribía, veía, resolvía, pero no tocaba nada. Google intenta ahora romper ese cristal. El sistema llamado Gemini Robotics 2 apunta a la inteligencia corporeizada ; no una mente que describe el mundo a distancia, sino una que actúa dentro de él.
Piensen en su café de la mañana: la mano busca el asa, los dedos se cierran, el agarre se ajusta al peso. Ningún cálculo de distancia, ninguna pesada de fuerzas contra la cerámica; el cerebro resuelve años de experiencia bajo la conciencia. Pidan el mismo gesto a un robot y el cuadro cambia: hallar la taza, elegir el asa, sostener el ángulo, dosificar la fuerza, compensar el peso y guardar el equilibrio durante el traslado. Cada paso depende de hechos que pueden diferir del intento anterior; la mesa puede estar torcida, la taza llena, alguien cruzarse. Un modelo de lenguaje puede razonar sobre una taza, pero el robot debe convertir ese razonamiento en fuerza, movimiento, equilibrio, ritmo y contacto.
El robot fabril escapa a la mayoría de estos apuros porque el entorno está ordenado alrededor de la máquina; repite el mismo gesto en el mismo punto miles de veces. El humanoide trabaja en un mundo construido para el humano: manijas a altura humana, estantes al alcance de la mano, escaleras para dos piernas. La tesis del ponente se afila aquí: más que especialistas de una sola tarea, el robot generalista capaz de oficios variados creará más valor; las máquinas de espectáculo que corren y saltan son el escaparate, no la prueba.
Una pila de inteligencia en tres capas
Del lado de DeepMind, la arquitectura descansa en tres piezas. Al centro, el modelo de acción: toma la imagen de cámara más la instrucción en lenguaje y las convierte en movimiento. Arriba, la capa de razonamiento llamada ER2 lee la escena, parte el trabajo en pasos, sigue el progreso y revisa el plan cuando lo real desobedece. Abajo corre una versión que vive directamente en la máquina, eliminando el viaje de ida y vuelta a un servidor lejano. Como confirman las páginas de producto de DeepMind, este modelo embarcado se adapta a un cuerpo nuevo en horas y con menos de 200 ejemplos. En conjunto aparece una pila: captar la escena, decidir, convertir la decisión en movimiento, ejecutarla en local.
La mente de esta pila se ve mejor en la escena del garaje por ordenar. El usuario quiere un garaje revuelto limpio y las herramientas devueltas a su caja; el sistema toma juntos el guante de fregar y el frasco rociador, y los lleva a la caja transparente de más a la derecha en el estante alto. El modelo superior resuelve qué hacer, adónde ir y la pregunta más dura: cuándo la tarea cuenta por terminada. La capacidad que DeepMind documenta como seguimiento del éxito significa que el robot sabe si debe reintentar o detenerse; en formato multirrobot, las máquinas reconocen sus fuerzas mutuas y se reparten el trabajo.
La inteligencia de cuerpo entero y la prueba Apollo
Google prueba esta mente en Apollo 2, plataforma humanoide construida por Apptronik. La instrucción es simple: llevar la regadera a la caja verde del estante bajo. Pero caminar supera el vaivén de dos piernas; cada paso desplaza el centro de masa, cada extensión perturba el equilibrio, cada objeto asido cambia las fuerzas sobre el cuerpo. En el diseño de Apptronik, piernas, torso, brazos y manos deben obrar como un sistema coordinado único; la compañía llama exactamente a esto inteligencia de cuerpo entero . La demostración tiene éxito, con una nota honesta: la máquina se mueve más lenta y menos fluida que una persona; hacerlo una vez es espectáculo, hacerlo rápido y siempre es producto.
El cuello de botella de la destreza
La verdadera brecha se abre en los dedos. Una mano humana sostiene un huevo sin romperlo, gira una tapa, ata un nudo, siente el instante del contacto y corrige el agarre antes del desliz. La mano de cinco dedos montada en Apollo 2 ofrece 22 grados de libertad; la probabilidad de fallo crece con la soltura. Las evaluaciones de Google cifran el cuadro: desenroscar una bombilla logra 92 %, pero volver a enroscarla cae a 36 %; anudar una bolsa de basura llega a 44 %, barrer hacia el recogedor 32 %, cerrar una bolsa con zip en torno a 40 %. Para el humano, poner una bombilla es un gesto casi seguro; para el robot, un lance de dados. Caminar quizá aplauda, pero el tacto diario es el verdadero examen de la inteligencia física.
La transferencia entre cuerpos
La segunda prueba de la promesa generalista es si la inteligencia puede despegarse del cuerpo. Cada plataforma difiere en articulaciones, sensores, proporciones y límites; llevar un saber de un brazo a un humanoide se parece a ejecutar con otra mano lo aprendido de otro modo. Google responde corriendo la misma copia del modelo en tres cuerpos distintos: versiones de Apollo 2 con manos diferentes y un montaje de dos brazos con pinza. La adaptación del modelo embarcado a un cuerpo nuevo en horas y con pocos ejemplos cambia la economía: si ninguna máquina exige meses de entrenamiento especial, una inteligencia única puede desplegarse en cuerpos variados según las tareas. El horizonte es una capa de inteligencia escalable que sobrevive al cambio de hardware.
Pero un modelo solo generaliza cuanto su experiencia, y la experiencia física cuesta caro. Los modelos de lenguaje disponían de internet; miles de millones de páginas se copiaban digitalmente. El robot no tiene tal atajo: no puede aprender el tacto de una toalla leyendo, ni la fuerza de un cajón por descripción. Se cuentan cuatro fuentes: la teleoperación donde el humano pilota la máquina a distancia, los vídeos que graban a la gente trabajando, la simulación que ofrece millones de repeticiones en salas virtuales, y los datos que el robot recoge por sí mismo en el campo. Ninguna cubre sola las combinaciones de luz, superficie, objeto, humano y fallo que sirve el mundo físico.
La carrera de datos y Robot Park
La carrera humanoide se vuelve así una carrera por el tesoro de experiencia física. Figure, junto a Brookfield, construye una red de datos que cubre más de 100 000 viviendas y cientos de millones de metros cuadrados de oficinas y logística; su modelo Helix aprende la navegación solo desde grabaciones de cámaras portadas por humanos, y se orienta en cuartos reales sin demostración robótica. Según los informes de Figure, la transferencia sin ejemplos del vídeo humano a la navegación robótica se muestra por primera vez. El activo valioso ya no es el robot mismo; es el caudal de experiencia nacido entre los robots y los humanos de alrededor.
Google y Apptronik eligen fabricar la experiencia como en fábrica. Según el anuncio de Apptronik, el Robot Park ampliado en Austin el 30 de junio de 2026 hace trabajar flotas de Apollo 2 en tareas de logística, fabricación y comercio en casi 90 000 pies cuadrados, con sitios de clientes como Mercedes-Benz y GXO en la red. Cada agarre logrado se vuelve muestra de entrenamiento, cada intento fallido otra; hasta un transeúnte se vuelve dato. De ahí nace el ciclo de datos : los robots producen datos, los datos mejoran los modelos, los modelos mejores entran en más lugares y traen más datos. El despliegue se vuelve parte del entrenamiento.
Generalización y trabajo programable
El ciclo solo gira si la experiencia se convierte en saber reutilizable; repetir una señal débil un millón de veces no da ningún buen modelo. Un agarre que canta en un almacén puede romperse cuando la luz cambia; una mano que sostiene una caja seca resbala en superficie húmeda; un gesto seguro sin nadie cerca se vuelve riesgoso cuando un humano se acerca. El sistema debe aprender patrones en vez de memorizar, y razonar sobre escenas jamás vistas. Los bandos rivales atacan la misma pregunta por flancos distintos: la robótica Gemini de Google, Helix de Figure, la plataforma GR00T de Nvidia y el equipo Physical Intelligence; las arquitecturas difieren, la pregunta es una: ¿cómo la experiencia física se vuelve inteligencia reutilizable?
La capa ER2 intenta una respuesta colectiva: partir la tarea y repartirla entre robots. Uno se halla bien puesto para alzar, otro cerca del blanco, un tercero toma otra pieza; la mente superior fija el reparto del trabajo. Mientras un robot solo ocupa un punto único, un equipo comparte espacio y esfuerzo, cubriendo al miembro que se atasca. La dificultad es la coordinación bajo incertidumbre: dos robots en armonía en una sala controlada nada prueban de cientos trabajando solos en un depósito caótico. Espacio disputado, material averiado, plan que se hunde a mitad de camino; la inteligencia compartida debe confiar en el razonamiento, no en guiones fijos, en esos instantes.
El marco económico bascula aquí también: la cuestión no es los oficios tomados en bloque, sino las tareas volviéndose programables una a una. El caminar, tomar, portar, clasificar, escanear, controlar y cargar de un turno cruzan el umbral por separado. Una máquina que pone una bombilla al 36 % no puede unirse a una línea de producción; una máquina más lenta que el humano sigue costosa en la mayoría de tareas. El futuro cercano no trae millones de humanoides reemplazando obreros, sino una ampliación gradual del caudal de tareas que vale automatizar; la frontera retrocede con cada ganancia.
Seguridad: saber cuándo no actuar
Cuando el software se equivoca, el resultado acaba en la papelera; cuando una máquina física se equivoca, los bienes se rompen y la gente se hiere. La destreza más crítica del sistema puede ser pues saber detenerse: decir lo que ve, dónde se halla su cuerpo, distinguir objetos y humanos, juzgar lo peligroso y cuándo pedir ayuda. Google sonda este frente con los baremos ASIMOV; la primera versión, presentada en CoRL 2025, generaba automáticamente constituciones de robots y elevaba la alineación de conductas a 84,3 %, publicada abiertamente vía GitHub. La segunda versión prueba la percepción del peligro físico, y la versión agéntica califica el rechazo de tareas peligrosas, la parada en instantes críticos y la consulta a humanos. La visión final se ata a este umbral: en la ruta hacia la AGI física, la cuestión ya no es si la máquina analiza la orden de tomar la taza; es dónde se halla la taza, cuán frágil puede ser, quién se halla cerca y qué hacer cuando el plan falla. En cuanto la inteligencia gana un cuerpo, el mundo mismo se suma al examen.
Momentos clave
Comentario de la IA
"El ponente narra la hoja de ruta de Google como una convincente historia de arquitectura, pero las puntuaciones de destreza delatan una máquina aún aprendiz. El frente a vigilar no son las demos; es la velocidad con que los datos de campo se vuelven modelos."
Evaluación de la IA
La objeción más fuerte es que el relato del ciclo de datos gira demasiado redondo. Amasar datos de campo solos no produce ninguna generalización; los registros de teleoperación portan los hábitos del operador, y las simulaciones las hipótesis de su motor físico. Del lado de Figure, la transferencia de navegación desde el vídeo humano impresiona, pero caminar y asir son penas distintas; en trabajos ricos en contacto como sostener, torcer y sentir, la señal del vídeo humano flaquea. Así la escala de datos crece sin que la riqueza del contacto siga, y el ciclo puede frenarse.
Los blancos de la presentación también resaltan. El consumo de energía, el coste horario de explotación y el factor de lentitud frente al humano jamás alcanzan cifras. Del lado de Apptronik, las dimensiones de Apollo 2 siguen inéditas, así que pegar las cifras de la primera generación de Apollo en la máquina nueva induciría a error. Del lado de la seguridad, los baremos ASIMOV corren en escenas de laboratorio; probar cientos de robots a la vez en un depósito atestado es un problema de escala de otro orden.
El marco del ponente orbita alrededor de Google y DeepMind; los enfoques rivales solo tienen un breve desfile. La plataforma GR00T de Nvidia, el modelo Helix de Figure y el equipo Physical Intelligence se nombran de paso; pero sus estrategias de datos difieren de raíz. La asociación Apptronik y el elogio de Robot Park también suenan en un sentido; ninguna fuente independiente audita la calidad de los datos de campo. Nada de esto vuelve falso el relato, pero marca su eje: no un panorama del sector, una defensa de la hoja de ruta de Google.
El punto práctico para los lectores es neto: los humanoides tomarán tareas aisladas antes que oficios. Un rellenado de estante, un porteo de caja o un simple orden se automatizan en cuanto se cruza el umbral de fiabilidad; ninguna decisión de inversión debería preceder ese paso. Tres medidas merecen seguimiento: las tasas de éxito en ensayos repetidos, el coste de ajuste a un cuerpo nuevo y la velocidad de conversión de los datos de campo en mejoras del modelo. Todo piloto comprado antes de sus avances sigue un espectáculo costoso.
Fuentes
6 enlaces; ninguna otra noticia publicada los cita. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
inteligencia artificial · robótica · google deepmind · robot humanoide · automatización