Alibaba abre con una pregunta directa: ¿cuántos toques necesitas en el teléfono para reservar un viaje? Qwen Intelligence, presentado el 22 de septiembre en la Conferencia Apsara de Hangzhou, responde que deberían ser cero. No es un chatbot para descargar ni una actualización de Qwen en el navegador, sino una pila agentica completa que se entrega a los fabricantes para integrar agentes dentro del teléfono. Honor es el primer socio, con la serie Honor Magic9 y el Robot Phone como primeros dispositivos el 28 de septiembre. En palabras de Steven Hoi, jefe de Qwen Mobile AI en Token Foundry y VP de Alibaba Token Hub, el smartphone agentico aspira a ser la puerta principal entre la IA personal y el mundo físico — el teléfono deja de ser un dispositivo que operas para convertirse en uno que opera por ti.
Qué es Qwen Intelligence — y qué no es
La arquitectura tiene tres capas. Abajo, un modelo base Qwen optimizado para móvil desde el inicio, no un modelo general grande comprimido, por lo que funciona con menos coste en el dispositivo. En medio, una capa de plataforma modular: despliegue independiente de modelos, personalización del harness, gobierno unificado de herramientas, evaluación automatizada y coordinación dispositivo-nube que distribuye el trabajo según velocidad y coste. Arriba, agentes empaquetados para necesidades verticales. El fabricante puede tomar toda la pila o integrar piezas en su sistema. Esa modularidad, junto al plan de inversión de 380 000 millones de RMB de Alibaba, presenta Qwen como sistema operativo de la era IA más que como un único modelo.
Tres agentes, tres oficios: el Planificador piensa, Uso actúa, Creativo produce
El trío de lanzamiento aclara los roles: el Agente Planificador Móvil piensa, el Agente de Uso Móvil actúa y el Agente Creativo Móvil produce. El Planificador es el cerebro — planificación, descomposición, orquestación de herramientas y ajuste dinámico. La demo de Alibaba es organizar un viaje de negocios a Shanghai el lunes, dividido en vuelos, hotel, eventos de calendario e itinerario. Si un vuelo se cancela, la memoria y los servicios proactivos reprograman sin pedir que reexpliques todo; el contexto ya está retenido. El Creativo es deliberadamente ligero, pensado para generar y editar imágenes en el teléfono a partir de una frase en unos 3 segundos, presentado como cerca del doble de rápido que los rivales.
Lo que mantiene honesto al Planificador es el harness: capa que retiene memoria y estado, conserva restricciones en turnos largos y alinea lo que dijiste con lo que realmente devolvieron las herramientas. Pide cambiar un ajuste y edita solo eso, sin reescribir todo. Las demos destacan comportamientos donde la mayoría de asistentes falla: detectar un desajuste entre conversación y reporte de herramienta confiando en la herramienta, esperar a que termine una descarga antes de nombrar el archivo en la siguiente app, y recuperarse de una conversión fallida apoyándose en la calculadora. En números, el Agente Planificador 27B logra 77.05% global en MobilePA-Bench, primero entre los sistemas evaluados y 9.83 puntos por encima de su propia baseline, pero la brecha con el segundo sigue estrecha — avance medible, no paliza.
Agente de Uso: API primero, pantalla como respaldo
La idea inteligente del Agente de Uso es cómo elige actuar. Híbrido API-first, GUI-fallback: si la app ofrece una conexión estructurada la usa porque es más rápida y fiable; si no, vuelve a operar la pantalla como un humano. Alibaba subraya límites de seguridad estrictos y protección de privacidad. Los números divulgados son sólidos: 82.1 en MobileWorld, 92.2 en MobileWorld-Real y 97.5 en AndroidDaily, con 90% de éxito extremo a extremo. Gadget Pilipinas cita hasta 91.8% de precisión en teléfonos Honor en flujos de más de 100 pasos. La misma tabla deja detrás a modelos de ByteDance, OpenAI, Anthropic y Google. Más que el puntaje, importa el método: entrenamiento sobre más de 100 smartphones y 150+ aplicaciones, en condiciones reales, no en simulador.
Ese énfasis en lo real es crítico porque lo salvaje es donde los agentes se rompen. MobileWorld-Real fue construido para ello: más de 400 tareas en más de 100 apps. La justificación es directa — un sandbox no reproduce una app que cambia de layout de la noche a la mañana, avisos de permisos, captchas, pop-ups o una caída de red en el paso 40. El repertorio de gestos lo refleja: no solo toque, sino clic, pulsación larga, escritura, apertura de app, arrastre, atrás/inicio, comando bash, llamada API directa y pregunta a mitad de tarea. Mejor aún, no avanza golpe a golpe sino que completa varios movimientos en una decisión, de ahí la velocidad. La huella no es solo teléfono: el mismo agente cubre ordenador y navegador, con 79.5 en OSWorld-Verified y 73.6 en WebArena, con cerca del 40% de tareas de escritorio en comandos CLI agrupados.
Imágenes en tres segundos y cuatro benchmarks abiertos
La ligereza del Creativo es intencional: pasar de una frase a una imagen utilizable rápido, sin empujar todo a la nube. Alibaba enmarca 3 segundos como cerca del doble de rápido que la competencia, pero el gesto más subestimado es abrir los benchmarks. Cuatro son públicos: MobilePA-Bench para planificación, MobileWorld para ejecución cruzada, MobileWorld-Real para rendimiento en dispositivo real y MobileWorld-Safety para seguridad. MobilePA-Bench es grande: 1 705 tareas de evaluación, 212 herramientas, 13 dominios funcionales y 89 subcategorías, probando uso de herramientas, memoria, uso de habilidades y colaboración entre subagentes. MobileWorld tiene licencia Apache en GitHub, 201 tareas en 20 apps, y su artículo va camino a ACL 2026.
Cómo está construido MobileWorld explica la confianza. Corre en un contenedor Docker con un dispositivo Android virtual rooteado dentro. En lugar de apuntar a servicios vivos mutables, aloja sus propias apps de código abierto: Mattermost para chat de equipo, Mastodon para social y Mole for Uni para compras. Como el backend es propio, pueden verificar directamente en base de datos si un mensaje se envió. Se toma una instantánea del dispositivo, cada ejecución parte del mismo teléfono — mismo inicio, resultados reproducibles. Dos tipos de tareas cubren huecos habituales: aquellas donde el agente debe volver y preguntarte algo y aquellas con herramientas Model Context Protocol, prueba híbrida no solo toques. Ese diseño explica por qué la coordinación dispositivo-nube está en el centro, no como añadido.
Quién accede y cuándo
Quién puede tocarlo hoy depende del carril. Usuario general: comprar un teléfono que lo traiga, la serie Honor Magic9 y el Robot Phone primero. Desarrollador: Qwen Intelligence vía web oficial y servicios de Alibaba Cloud, benchmarks totalmente abiertos — descargas MobileWorld, lo ejecutas en Docker y pruebas tu propio agente en las mismas tareas. Investigador o curioso: informes técnicos de ambos agentes en abierto, con demos grabadas que exponen llamadas a herramientas, razonamiento, fallos y recuperaciones — transparencia rara. En la hoja de ruta están memoria personalizada con asistencia proactiva, interacción multimodal y agentes verticales de socios. La memoria bien hecha es el umbral que convierte la herramienta en ayudante útil, y Alibaba la señala aún en pipeline, así que todo volverá a moverse cuando aterrice.
La línea que la mayoría pasará por alto es la selección. Estos agentes buscan en apps, comparan y eligen una opción por ti; nunca ves diez resultados, ves una respuesta. Lo mismo ya ocurre en Google AI Overviews, ChatGPT, Perplexity y Gemini: menos resultados significa más decisiones tomadas por ti. La pregunta ya no es si tu contenido rankea, sino si una IA te elige cuando alguien pregunta. Qwen Intelligence está construido en tres capas para esa realidad — base móvil, plataforma que gobierna herramientas y evalúa, agentes empaquetados arriba. El fabricante toma todo o elige piezas, como superponer un sistema operativo más que añadir una función.
Qué mirar ahora: memoria, velocidad y economía de la selección
Tres apuntes para llevar. Primero, no lo encasilles como solo teléfono; el Agente de Uso ya maneja ordenador y navegador, la disciplina de escribir instrucciones claras paso a paso para un agente sirve en todas partes — practícalo ahora. Segundo, estudia el patrón API-first, GUI-fallback como lección para tus flujos: dale a tu IA una conexión directa cuando la tengas; el control de pantalla es respaldo, no defecto, porque es más lento y frágil. Tercero, vigila la capa de memoria; memoria personalizada con asistencia proactiva anunciada en pipeline, y cuando caiga el asistente pasará de reactivo a anticipativo. La prueba cercana es el lanzamiento Honor del 28 de septiembre y la reproducibilidad de los benchmarks abiertos: no el podio, sino repeticiones en más de 100 teléfonos reales contarán la historia real.
Momentos clave
Comentario de la IA
"Mi lectura: Alibaba no busca ganar con modelos más grandes sino instalándose en el teléfono. El trío de agentes se parece menos a un asistente único y más a una capa de sistema — memoria, gobierno de herramientas y equilibrio dispositivo-nube en un kit. El acuerdo con Honor es más que hardware: una vitrina en vivo."
Evaluación de la IA
Fortaleza: el trabajo saca la evaluación de los simuladores a teléfonos reales a escala — más de 100 teléfonos y 150+ apps con recolección de trayectorias — y los números (77.05% en MobilePA-Bench y 82.1/92.2/97.5 para Uso) forman una prueba en capas, no un puntaje aislado. Cuatro benchmarks abiertos, con MobileWorld bajo licencia Apache, muestran una transparencia inusual sobre reproducibilidad.
Límites: el liderazgo es estrecho — la brecha del Planificador con el segundo es pequeña y el 90% de extremo a extremo depende de cobertura; la mezcla de apps y escenarios de red/permisos frágiles quedan en detalle. Límites estrictos de seguridad y privacidad se afirman sin logs de auditoría sobre pagos, borrados o permisos. Las imágenes en 3 segundos valen en prompt único, no necesariamente en edición multi-paso más pesada.
Contra-tesis: la economía de una sola respuesta es tanto riesgo como comodidad — cuando el agente elige por ti, las elecciones invisibles se multiplican y una elección sesgada desaparece dentro de una sola respuesta. Y API-first solo vale si las apps abren una API; en momentos críticos el agente puede caer al modo más frágil, separando promesa y experiencia.
Práctica: para dueños, el lanzamiento Honor tras el 28 de septiembre será la prueba real; para constructores, correr MobileWorld en Docker en las mismas tareas es un espejo barato y honesto; para equipos, dar vía directa donde haya API y dejar el control de pantalla como respaldo hasta que llegue la memoria. Las repeticiones y la lectura de trazas importarán más que el marcador.
Fuentes
8 enlaces; ninguna otra noticia publicada los cita. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
- @youtube.com YouTube — Alibaba Qwen Intelligence: tres agentes móviles
- @gadgetpilipinas.net https://www.gadgetpilipinas.net/2026/09/alibaba-qwen-intelligence-agentic-phones/
- @alibabacloud.com https://www.alibabacloud.com/en/press-room/alibabacloudunveilsstrategicroadmaps?_p_lc=1
- @digitalphablet.com https://digitalphablet.com/ai/alibaba-launches-qwen-ui-agent-surpassing-gpt-5-6-and-claude-4-8/
- @honor.com https://www.honor.com/global/news/honor-magic8-china-launch/
- @pandaily.com https://pandaily.com/alibaba-qwen-intelligence-phone-agent-stack-honor-magic9
- @news.cocoloop.cn https://news.cocoloop.cn/en/2026/08/qwen-ui-agent-real-device/
- @techadvisor.com https://www.techadvisor.com/article/2249860/app-less-ai-phone-terrible-idea.html
alibaba qwen intelligence · honor magic9 · agentes moviles · apsara 2025 · mobileworld