Alibaba ouvre avec une question nette : combien d'appuis faut-il pour réserver un voyage sur ton téléphone ? Qwen Intelligence, dévoilé le 22 septembre à la conférence Apsara à Hangzhou, répond que ce nombre devrait être zéro. Ce n'est pas une appli à télécharger ni une mise à jour Qwen dans le navigateur, mais une pile agentique complète confiée aux fabricants pour intégrer des agents dans le téléphone. Honor est le premier partenaire, avec la série Honor Magic9 et le Robot Phone attendus le 28 septembre comme premiers appareils. Selon Steven Hoi, responsable Qwen Mobile AI chez Token Foundry et VP d'Alibaba Token Hub, le smartphone agentique vise à devenir la passerelle entre l'IA personnelle et le monde physique — le téléphone cesse d'être opéré pour opérer à ta place.
Qwen Intelligence, ce que c'est — et ce que ce n'est pas
L'architecture tient en trois couches. En bas, un modèle de fondation Qwen optimisé pour le mobile dès la conception, non un gros modèle générique comprimé, donc moins coûteux sur l'appareil. Au milieu, une couche plateforme modulaire : déploiement indépendant des modèles, personnalisation du harness, gouvernance unifiée des outils, évaluation automatisée et coordination appareil-cloud qui répartit le travail selon vitesse et coût. Au sommet, des agents packagés pour besoins verticaux. Le fabricant peut prendre toute la pile ou intégrer des briques dans son système. Cette modularité, avec le plan d'investissement de 380 milliards RMB d'Alibaba, installe Qwen comme système d'exploitation de l'ère IA plutôt que simple modèle.
Trois agents, trois métiers : le Planificateur pense, l'Utilisateur agit, le Créatif produit
Le trio de lancement clarifie les rôles : l'Agent Planificateur Mobile pense, l'Agent d'Usage Mobile agit, l'Agent Créatif Mobile produit. Le Planificateur est le cerveau — planification, décomposition, orchestration d'outils et ajustement dynamique. La démo d'Alibaba est un voyage d'affaires à Shanghai lundi, découpé en vols, hôtel, événements d'agenda et itinéraire. Si un vol est annulé, la mémoire et les services proactifs reprogramment sans tout réexpliquer ; le contexte est déjà gardé. Le Créatif est volontairement léger, prévu pour générer et éditer des images sur téléphone à partir d'une phrase en environ 3 secondes, annoncé environ deux fois plus vite que les rivaux.
Le harness maintient le Planificateur honnête : couche qui retient mémoire et état, conserve les contraintes sur de longs échanges et aligne ce que tu as dit avec ce que les outils renvoient réellement. Demande un changement de paramètre et il ne réécrit que cela. Les démos soulignent des comportements où la plupart des assistants échouent : détecter un décalage entre conversation et rapport d'outil en faisant confiance à l'outil, attendre la fin d'un téléchargement avant de nommer le fichier dans l'app suivante, et récupérer une conversion ratée via la calculatrice. Côté chiffres, l'Agent Planificateur 27B atteint 77.05% global sur MobilePA-Bench, premier parmi les systèmes évalués et 9.83 points au-dessus de sa propre baseline, mais l'écart avec le second reste serré — progrès mesurable, pas d'écrasement.
Agent d'Usage : API d'abord, écran en secours
L'astuce de l'Agent d'Usage est le choix du canal. Hybride API-first, GUI-fallback : si l'app offre une connexion structurée, il l'utilise car plus rapide et fiable ; sinon il repasse en contrôle d'écran comme un humain. Alibaba insiste sur des limites de sécurité strictes et la protection de la vie privée. Les chiffres annoncés sont solides : 82.1 sur MobileWorld, 92.2 sur MobileWorld-Real et 97.5 sur AndroidDaily, avec 90% de réussite de bout en bout. Gadget Pilipinas cite jusqu'à 91.8% de précision sur les téléphones Honor sur des flux dépassant 100 étapes. La même feuille place les modèles ByteDance, OpenAI, Anthropic et Google derrière. Plus que le score, la méthode compte : entraînement sur plus de 100 smartphones et 150+ applications, en conditions réelles, pas en simulateur.
L'insistance sur le réel n'est pas décorative — c'est là que les agents cassent. MobileWorld-Real a été conçu pour cela : plus de 400 tâches sur plus de 100 apps. La justification est directe — un sandbox ne reproduit pas une app qui change de layout du jour au lendemain, les prompts de permission, captchas, pop-ups ou une coupure réseau à l'étape 40. Le répertoire de gestes reflète cela : pas seulement tap, mais clic, appui long, saisie, ouverture d'app, glisser, retour/accueil, commande bash, appel API direct et question posée en cours de tâche. Mieux, il n'avance pas coup par coup mais enchaîne plusieurs mouvements en une décision, d'où la vitesse. L'empreinte dépasse le téléphone : même agent sur ordinateur et navigateur, avec 79.5 sur OSWorld-Verified et 73.6 sur WebArena, environ 40% de tâches desktop en commandes CLI groupées.
Images en trois secondes et quatre benchmarks ouverts
La légèreté du Créatif est assumée : passer d'une phrase à une image utilisable vite, sans tout pousser vers le cloud. Alibaba cadre 3 secondes comme environ deux fois plus rapide que la concurrence, mais le geste le plus sous-estimé est d'ouvrir les benchmarks. Quatre sont publics : MobilePA-Bench pour la planification, MobileWorld pour l'exécution inter-apps, MobileWorld-Real pour la performance sur appareil réel et MobileWorld-Safety pour la sécurité. MobilePA-Bench est vaste : 1 705 tâches d'évaluation, 212 outils, 13 domaines fonctionnels et 89 sous-catégories, testant usage d'outils, mémoire, compétences et collaboration entre sous-agents. MobileWorld est sous licence Apache sur GitHub, 201 tâches sur 20 apps, article en route vers ACL 2026.
La construction de MobileWorld explique la confiance. Il tourne dans un conteneur Docker avec un appareil Android virtualisé rooté. Au lieu de viser des services live mutables, il héberge ses propres apps open source : Mattermost pour le chat d'équipe, Mastodon pour le social et Mole for Uni pour le shopping. Le backend étant interne, l'équipe vérifie directement en base si un message a été envoyé. Un snapshot de l'appareil est pris, chaque run part du même téléphone — même point de départ, résultats reproductibles. Deux types de tâches comblent des manques habituels : celles où l'agent doit revenir te poser une question et celles utilisant des outils Model Context Protocol, test hybride pas seulement tap. Cette conception explique pourquoi la coordination appareil-cloud est au centre, non en annexe.
Qui y accède et quand
Qui peut le toucher aujourd'hui dépend du couloir. Grand public : acheter un téléphone qui l'embarque, la série Honor Magic9 et le Robot Phone d'abord. Développeur : Qwen Intelligence via site officiel et services Alibaba Cloud, benchmarks entièrement ouverts — tu télécharges MobileWorld, le lances en Docker et testes ton agent sur les mêmes tâches. Chercheur ou curieux : rapports techniques des deux agents en accès libre, avec démos enregistrées exposant appels d'outils, raisonnement, échecs et récupérations — rare transparence. La feuille de route annonce mémoire personnalisée avec assistance proactive, interaction multimodale et agents verticaux partenaires. La mémoire bien faite est le seuil qui transforme l'outil en assistant utile, et Alibaba la signale encore en chantier, donc tout bougera à nouveau à son arrivée.
La ligne que la plupart manquera est la sélection. Ces agents cherchent dans les apps, comparent et choisissent une option pour toi ; tu ne vois jamais dix résultats, tu vois une réponse. C'est déjà le cas dans Google AI Overviews, ChatGPT, Perplexity et Gemini : moins de résultats signifie plus de décisions prises pour toi. La question n'est plus ton contenu est-il classé, mais une IA te choisit-elle quand on lui demande. Qwen Intelligence est construit en trois couches pour cette réalité — base mobile, plateforme qui gouverne les outils et évalue, agents packagés au sommet. Le fabricant prend tout ou choisit, comme on superpose un OS plutôt que d'ajouter une fonction.
À suivre : mémoire, vitesse et économie de la sélection
Trois points à garder. D'abord, ne réduis pas cela au téléphone ; l'Agent d'Usage gère déjà ordinateur et navigateur, l'art d'écrire des instructions pas à pas pour un agent sert partout — entraîne-toi maintenant. Ensuite, étudie le motif API-first, GUI-fallback comme leçon pour tes flux : donne à ton IA une connexion directe quand tu l'as ; le contrôle écran est secours, pas défaut, car plus lent et fragile. Enfin, surveille la couche mémoire ; mémoire personnalisée avec assistance proactive annoncée en pipeline, et quand elle tombera l'assistant passera de réactif à anticipatif. Le test proche est le lancement Honor du 28 septembre et la reproductibilité des benchmarks ouverts : pas le podium, mais des répétitions sur plus de 100 vrais téléphones diront l'histoire réelle.
Moments clés
- Zero taps — pourquoi un voyage devrait prendre zero geste
- Qwen Intelligence : plateforme, pas application
- Trois agents — le planificateur pense, l'utilisateur agit
- Économie d'une seule réponse — pas dix résultats
- Harness et mémoire — replanifier après annulation
- Test sur appareils réels — 100 téléphones 150 applis
Commentaire de l’IA
"Mon avis : Alibaba ne cherche pas à gagner avec des modèles plus gros mais en s'installant dans le téléphone. Le trio d'agents ressemble moins à un assistant unique qu'à une couche OS — mémoire, gouvernance d'outils et équilibre appareil-cloud en un kit. Le partenariat Honor est donc plus qu'un accord matériel : une vitrine live."
Évaluation de l’IA
Force : le travail sort l'évaluation des simulateurs vers de vrais téléphones à l'échelle — plus de 100 téléphones et 150+ applis avec collecte de trajectoires — et les scores (77.05% sur MobilePA-Bench et 82.1/92.2/97.5 pour l'agent d'usage) forment une preuve en couches, pas un score isolé. Quatre benchmarks ouverts, dont MobileWorld sous licence Apache, affichent une transparence rare sur la reproductibilité.
Limites : le leadership est mince — l'écart du Planificateur avec le second est faible et le 90% de bout en bout dépend de la couverture ; mix d'apps et scénarios réseau/permissions fragiles restent en détail. Des limites strictes de sécurité et confidentialité sont affirmées sans journaux d'audit sur paiements, suppressions ou permissions. Les 3 secondes d'image valent en prompt unique, pas forcément en édition multi-étapes plus lourde.
Contre-thèse : l'économie d'une seule réponse est autant risque que confort — quand l'agent choisit pour toi, les choix invisibles se multiplient et un choix biaisé disparaît dans la réponse unique. Et l'API-first ne vaut que si les apps ouvrent une API ; aux moments critiques l'agent peut retomber sur le mode le plus fragile, écartant promesse et vécu.
Piste pratique : pour les possesseurs, le lancement Honor après le 28 septembre sera le vrai test ; pour les builders, lancer MobileWorld en Docker sur les mêmes tâches est un miroir bon marché et honnête ; pour les équipes, donner une voie directe où une API existe et garder l'écran en secours jusqu'à l'arrivée de la mémoire. Les répétitions et la lecture des traces primeront sur le tableau des scores.
Sources
8 liens ; aucun autre article publié ne les cite. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
- @youtube.com YouTube — Alibaba Qwen Intelligence : trois agents mobiles
- @gadgetpilipinas.net https://www.gadgetpilipinas.net/2026/09/alibaba-qwen-intelligence-agentic-phones/
- @alibabacloud.com https://www.alibabacloud.com/en/press-room/alibabacloudunveilsstrategicroadmaps?_p_lc=1
- @digitalphablet.com https://digitalphablet.com/ai/alibaba-launches-qwen-ui-agent-surpassing-gpt-5-6-and-claude-4-8/
- @honor.com https://www.honor.com/global/news/honor-magic8-china-launch/
- @pandaily.com https://pandaily.com/alibaba-qwen-intelligence-phone-agent-stack-honor-magic9
- @news.cocoloop.cn https://news.cocoloop.cn/en/2026/08/qwen-ui-agent-real-device/
- @techadvisor.com https://www.techadvisor.com/article/2249860/app-less-ai-phone-terrible-idea.html
alibaba qwen intelligence · honor magic9 · agents mobiles · apsara 2025 · mobileworld