La generalización inesperada de los agentes de código es una de las mayores sorpresas recientes. Entrenados con millones de líneas, adquirieron una disciplina que se derrama a dominios inéditos. Ese salto llega a los brazos robóticos, y los modelos generales gobiernan cuerpos distintos con un solo lenguaje. Por primera vez tiembla la regla de un cerebro por cuerpo.
La tesis Isola y el titiritero en la nube
El investigador del MIT Phillip Isola nombra esta ruptura en su ensayo del 7 de septiembre de 2026. Un modelo de lenguaje, dice, puede usar un robot como herramienta igual que una calculadora o una computadora. Según el MIT, cada robot conectado se vuelve una mano potencial para modelos como Fable y Astra. La inteligencia queda en la nube, el software del cuerpo no cambia y las mejoras llegan por aire.
Los fundadores de Waddle Labs, Jaime y Vincent, quieren probarlo en hardware real. El equipo construye una capa de ejecución para que los grandes modelos dirijan con eficacia, recoge datos y entrena mejores modelos. Según waddlelabs.ai, el agente divide la meta en subtareas, mira las cámaras, escribe código de control y llama modelos de acción listos como herramientas. La apuesta es empezar sin recoger datos nuevos para cada brazo o pinza.
El lado RoboCurve sostiene la honestidad con medición. El cofundador Jay dice probar brazos, pinzas, humanoides y cuadrúpedos con igual rigor. Según robocurve.org, la empresa de beneficio público impulsada por Y Combinator publica las capacidades frontera. Su marco abierto Inspect Robots quiere sustituir los clips escogidos por una vara continua y estándar.
Clips breves virales avivaron el debate. Uno muestra un gran modelo aflojando una tapa, otro dos robots repartiéndose trabajo y otro un brazo abriendo un bolígrafo. Según The Decoder, la nueva prueba StationeryBench puso número duro: en 200 ensayos con YAM de doble brazo, Astra terminó 7 de 100 tareas y el rival cero. La mediana de 46 contra 12 volvió medible el salto espacial.
RT2, acción directa y brecha de pensamiento
Google DeepMind presentó RT2 en 2023 como primera parada seria, y su límite explica el cambio. Según DeepMind, la base PaLI-X se ajustó con demostraciones de 13 robots durante 17 meses junto a un mesón. En vez de inglés, el modelo emitía posiciones del efector final convertidas en órdenes articulares. El preentrenamiento visual y lingüístico a escala web mejoró mucho la generalización. Pero el modelo debía actuar en una pasada, como obligado a imprimir la marca final en la analogía GSM8K sin mostrar el cálculo, mientras los agentes actuales abren un intervalo de cadena de pensamiento , piensan varios turnos y luego emiten una orden, una flexibilidad decisiva.
La intuición coincide con la lección amarga: con más autonomía y cómputo emergen destrezas afinadas. Liberar un gran modelo base sale más barato y llega más lejos que encerrar la arquitectura en datos solo robóticos. El linaje Google Research tras Code as Policies apunta al tipo de dato por eso. Según los escritos research, pares de instrucción y código con pocos ejemplos sirven muchas tareas con políticas de código modulares.
Políticas de código y bibliotecas
Code as Policies, anunciado en noviembre de 2022 por Liang y Zeng, redefinió programar robots. Primitivas como tomar, levantar e ir-a se exponen como funciones Python que el modelo compone. Según el artículo arXiv 2209.07753, los modelos producían secuencias sensatas al primer intento sin datos robóticos nuevos. Aquel éxito encendió el trabajo posterior con agentes.
Voyager llevó la idea a fabricar herramientas en Minecraft. El agente parte de funciones Python, compila archivos como francois.py durante las corridas y los vuelve habilidades llamables. El aprendizaje en contexto brilla porque pocos ejemplos enseñan la rutina. Pero los ensayos mostraron su irregularidad: el éxito oscila, se satura tras 20 a 40 ejemplos y sumar más pasada la ventana llena deja de ayudar.
De ahí la escalera de Francois: pruebas rápidas en contexto, luego memoria aumentada, adaptadores LoRA de rango bajo y arriba ajuste total o refuerzo. Una firma con datos de conducción ilimitados como Tesla jamás se conformaría con métodos en contexto. Compilar trazas de estado-acción-recompensa del día en pesos durante un pase tipo sueño prolonga la tradición DreamCoder.
Demo física y verdad de latencia
En la demo, el agente Ashra toma un cubo y lo deja en un bol solo con cámaras. El sistema avanza por turnos: llegan imágenes, el modelo da la próxima pose del efector final y el brazo va allí. Aquí el código parece menos una política completa que una serie de llamadas a herramientas . Las repeticiones deterministas como la aproximación se compilan, mientras la detección y los controles de fallo mantienen un modelo visual en el bucle.
La brecha entre la capa Waddle y el uso directo de Astra se ve en economía y velocidad. Pensar con un modelo gigante en cada paso es lento y caro. El equipo compila la primera traza exitosa en habilidad rápida para llamarla después. Según OpenAI, Astra logra 64.6 en Terminal-Bench Science, sobre la línea Fable 5.1, con un costo menor de un tercio. Si la duplicación mensual de velocidad sigue, el control casi en tiempo real se discutirá antes de fin de año.
Representación platónica y dos años
Otro apoyo viene de la ciencia cognitiva con la hipótesis de la representación platónica. El trabajo de Huh y colegas en el MIT muestra que los grandes modelos visuales y de lenguaje miden distancias entre datos de forma cada vez más parecida. Si converge, un gran modelo de lenguaje ya trae un fuerte modelo del mundo. Crecer con código y uso de computadora vence entonces al encierro robótico.
Los datos candidatos tras el salto de Astra encajan: uso de computadora más escenas CAD y Blender. Arrastrar un cursor para girar un objeto enseña arriba-abajo e izquierda-derecha como conceptos espaciales. Las interfaces que Xerox PARC modeló sobre el mundo físico hoy enseñan a los robots en reversa. Ensayos nube-robóticos al estilo Princeton reportan que un buen enlace cursor-robot mejora visible los puntajes físicos.
El pronóstico final es audaz: en dos años, robots generales que cumplen toda orden en lenguaje natural que un joven hábil haría a mano. Sería un momento ChatGPT para la robótica. Los propios ponentes advierten nudos duros: latencia, verificación de seguridad y poda de una biblioteca creciente. La dirección queda fijada: diversificar datos, dejar que el agente programe, mantener abierta la medición y compilar repeticiones en velocidad.
Momentos clave
Comentario de la IA
"El entusiasmo de los fundadores es contagioso, pero el énfasis de RoboCurve en la medición lo mantiene honesto. Esta charla vale porque traslada el debate robótico a los datos y la ingeniería."
Evaluación de la IA
El contraargumento más fuerte es la latencia y el control en tiempo real. Las plantas exigen reacciones en milisegundos mientras los modelos frontera piensan en segundos por turno. Las políticas pequeñas a bordo cubren hoy ese hueco y casi todo el capital va allí. Sin un giro en latencia y costo, la visión del titiritero no se generaliza.
Falta un marco de seguridad y responsabilidad. Una rutina de agarre mal escrita puede romper hardware caro o dañar a una persona. La charla cubre detección de fallos y replanificación, pero nunca nombra una capa formal de verificación. Escenas desordenadas como suelos mojados, talleres abarrotados y hogares llenos siguen poco probadas.
Los incentivos se ven: Waddle Labs vende infraestructura de agentes y RoboCurve vende credibilidad con medición. Ambos se benefician de la ola generalista y de un calendario optimista. Eso no invalida los datos, pero el pronóstico de robots generales en dos años merece un descuento.
El consejo práctico es no atar la inversión a un solo cuerpo. Los equipos que prueban políticas especialistas y agentes en la nube sobre el mismo brazo aprenden más rápido. Para equipos pequeños, lo más barato es dar una tarea de agarre con cámaras existentes a un agente que escribe código y guardar los fallos en una biblioteca. Quien mida primero verá primero qué trabajos se automatizan de verdad.
Fuentes
9 enlaces; 1 de ellos también citados por 17 otras noticias. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
- @youtube.com YouTube — Y Combinator
- @web.mit.edu MIT — Robot-Use Agents
- @waddlelabs.ai Waddle Labs — Introducing Waddle
- @robocurve.org RoboCurve — Real-world evaluations
- @deepmind.google Google DeepMind — RT-2
- @research.google Google Research — Code as Policies
- @arxiv.org arXiv — Platonic Representation Hypothesis
- @openai.com OpenAI — GPT-6 Astra
También citado por: Brain and Body: A Single-Screen Agent Setup with GPT-6 Astra on Hermes · Space Bunny Alpha: Inside OpenRouter's Free Anonymous AI Experiment · Building a Productive Card Collection App in Minutes with Base44 and GPT-6 Astra · Price War Begins: GPT-6 Sol and Luna Halve Model Costs · Gemini 4 Leak? 10 Interactive 3D Tests Against GPT-6 Astra and Fable 5.1 · Gemini 4 Pro Leaks, GPT-6 Soul in Testing: From Arena to Google Cloud, the Week's AI Shockwave · 10,000 Agents, 88 Hours, $1 Million: AI Mastermind #39 From Code to Cash to Autonomy · Cloning a Channel With One Prompt: The $33K Video Factory Built on GPT-6 Astra and Higgsfield · GPT-6 Astra Guide: How Horizontal Power Turns the Model Into Work Done · From Hand Sketch to Realistic Villa: A Showcase Video with GPT-6 Astra and Higgsfield MCP · The $500-a-Day Claim With GPT-6 Astra: Building Three Business Models End to End · When Agents Take the Job: Investing in the Stack After GPT-6 Astra (+5)
- @the-decoder.com The Decoder — Astra spatial leap
agentes robóticos · llm · waddle labs · robocurve · code as policies