Alibaba’nın sorduğu soru basit ama keskin: Telefonunda bir gezi ayarlamak için kaç kez dokunman gerekiyor? Cevabı sıfıra indirme iddiası, 22 Eylül’de Hangzhou’daki Apsara Konferansı’nda tanıtılan Qwen Intelligence’ın özeti. Platform, indirilen bir sohbet uygulaması veya tarayıcıya eklenen bir Qwen güncellemesi değil; telefon üreticisine verilen üç katmanlı, doğrudan cihaza gömülen bir ajan yığını. Honor ilk ortak, Magic9 serisi ve Robot Phone ise 28 Eylül’de bu yığınla çıkan ilk cihazlar. Steven Hoi’nin sözüyle, ajanlı telefon kişisel yapay zekayı fiziksel dünyaya bağlayan ana geçit olmayı hedefliyor — telefon seni yöneten değil, senin adına çalışan cihaza dönüşsün isteniyor.
Qwen Intelligence Nedir, Ne Değildir
Mimari üç katmandan kurulmuş ve her katman farklı bir sorunu çözüyor. En altta telefon senaryoları için baştan optimize edilmiş Qwen tabanlı temel model var; büyük genel modeli zorla telefona sıkıştırma değil, cihazda daha az kaynakla koşan özel yapı. Ortada modüler platform katmanı: bağımsız model dağıtımı, harness özelleştirme, birleşik araç yönetimi, otomatik değerlendirme ve cihaz-bulut koordinasyonu. En üstte dikey ihtiyaçlara göre paketlenmiş ajanlar. Üretici isterse bütün yığını alıyor, isterse seçtiği modülü kendi sistemine ekliyor. Bu modülerlik, Alibaba’nın 380 milyar RMB’lik altyapı yatırımıyla birlikte tam yığın AI sağlayıcı söylemini ete kemiğe büründürüyor; modelden ajana kadar zinciri tek elde tutma stratejisi.
Üç Ajan, Üç Rol: Planlayıcı Düşünür, Kullanıcı Yapar, Yaratıcı Üretir
Lansman üç ajanla açılıyor ve isimler iş bölümü kadar net: Mobil Planlayıcı Ajan düşünür, Mobil Kullanım Ajanı yapar, Mobil Yaratıcı Ajan üretir. Planlayıcı, işin beyni; planlama, görev ayrıştırma, araç orkestrasyonu ve dinamik ayarlama ondan soruluyor. Alibaba’nın tanıtımdaki örneği Pazartesi için Şanghay iş gezisi ayarlama: uçuş rezervasyonu, otel, takvim etkinliği ve güzergah planı olarak parçalıyor. Uçuş iptal olursa hafıza ve proaktif hizmet devreye girip yeniden rezervasyon öneriyor; tüm geziyi baştan anlatman gerekmiyor, bağlam zaten tutuluyor. Yaratıcı ise hafif, telefon üstünde tek cümleden kullanılabilir görsel üretmeye odaklı, yaklaşık 3 saniyede görüntü, rakiplerinin yaklaşık iki katı hız iddiasıyla.
Planlayıcıyı ayakta tutan parça harness: hafıza ve durum tutan, uzun sohbetlerde kısıtları saklayan, söylediklerinle araçların döndürdüğü gerçek sonuçları hizalayan katman. Bir ayarı değiştir dediğinde her şeyi yeniden yazmıyor, sadece o ayarı değiştiriyor. Tanıtımdaki demoların anlattığı yetenekler sıradan asistanların tökezlediği yerler: konuşma ile araç raporu arasındaki uyumsuzluğu yakalayıp araca güvenmek, sonraki uygulamaya geçmeden dosya indirmesinin bitmesini beklemek, başarısız dönüşümü hesap makinesiyle kurtarmak. Rakam tarafında Planlayıcı Ajan 27B, MobilePA-Bench’te genel skorda 77.05% ile test edilen sistemler içinde ilk sırada, kendi taban modelinin 9.83 puan üzerinde; fark ikinciye karşı dar, devasa kopma değil. Bu da vaadin cilası değil, ölçülebilir marjı olduğunu ama liderliğin kırılgan kaldığını gösteriyor.
Kullanım Ajanı: Önce API, Olmazsa Ekran
Mobil Kullanım Ajanı’nın zekası nerede dokunduğu kadar nasıl dokunduğu. İlke API-öncelikli, GUI-yedek: Uygulama düzgün yapısal bağlantı verirse onu kullanıyor çünkü daha hızlı ve sağlam; vermezse insan gibi ekrana dönüp dokunma, kaydırma ve gezinme yapıyor. Alibaba bu sırada katı güvenlik sınırları ve gizlilik koruması vurguluyor. Rakamlar güçlü: MobileWorld’de 82.1, MobileWorld-Real’de 92.2, AndroidDaily’de 97.5 ve uçtan uca 90% başarı. Gadget Pilipinas aktarımına göre Honor AI telefonlarında 100 adımı aşan akışlarda 91.8% görev doğruluğu telaffuz ediliyor. Aynı tabloda ByteDance, OpenAI, Anthropic ve Google modellerinin geride bırakıldığı söyleniyor. Ham skor tek başına heyecan değil, yöntem belirleyici: 100’den fazla akıllı telefon ve 150’den fazla uygulamada görev kurma, iz toplama, eğitim ve değerlendirme gerçek cihazlarda yapılmış, simülatörde değil.
Gerçek cihaz vurgusu tesadüf değil, çünkü ajanların en çok çöktüğü yer laboratuvarın steril kutusu. MobileWorld-Real bunun için kurulmuş: 100’den fazla uygulama üzerinde 400’den fazla görev. Rapordaki gerekçe net: sandbox, bir gecede arayüz değiştiren uygulamayı, izin pencerelerini, captcha’ları, beklenmedik pop-up’ları veya 40. adımda kopan ağı yeniden üretemiyor. Kullanım Ajanı’nın hareket dağarcığı da bu yüzden sadece dokunma değil; klik, uzun basış, yazma, uygulama açma, sürükleme, geri/ana ekran, bash komutu, doğrudan API çağrısı ve görev sırasında sana soru sorma var. Üstelik her seferinde tek hamle değil, bir kararda birkaç hamle birlikte yapılıyor, hız da buradan geliyor. Telefonu aşan yan da var: Aynı ajan bilgisayar ve tarayıcıda da koşuyor, OSWorld-Verified’da 79.5 ve WebArena’da 73.6, masaüstü görevlerinin yaklaşık yüzde 40’ında toplu CLI komutları üretebiliyor.
Üç Saniyede Görsel ve Dört Açık Benchmark
Yaratıcı Ajan hafifliği bilerek seçilmiş; telefonda tek cümleden kullanılabilir görsele giden yolun kısalması, ağır modelin cihaz dışına itilmeden koşabilmesi demek. Alibaba 3 saniye iddiasını iki kat hızla çerçeveliyor ama asıl az konuşulan hamle benchmark’ların kendisini açması. Dört benchmark kamuya açık: planlama için MobilePA-Bench, çapraz uygulama yürütme için MobileWorld, gerçek cihaz performansı için MobileWorld-Real ve güvenlik için MobileWorld-Safety. MobilePA-Bench küçük değil: 1.705 değerlendirme görevi, 212 araç, 13 işlevsel alan ve 89 alt kategori, araç kullanımı, hafıza, beceri kullanımı ve alt-ajan iş birliğini ölçüyor. MobileWorld GitHub’da Apache lisanslı, 20 uygulama üzerinde 201 görev barındırıyor ve araştırma makalesi ACL 2026’ya kabul yolunda.
MobileWorld’un kuruluşu akıllıca, çünkü canlı servislere işaret etmek yerine kendi açık kaynak uygulamalarını barındırıyor: ekip sohbeti için Mattermost, sosyal için Mastodon, alışveriş için Mole for Uni. Arka uç kendilerinin olduğu için bir mesaj gerçekten gönderildi mi diye doğrudan veritabanına bakabiliyorlar. Cihaz anlık görüntüsü alınıyor, her koşu özdeş telefondan başlıyor; aynı başlangıç, herkesin güvenebileceği tekrarlanabilir sonuç demek. İki görev tipi çoğu benchmark’ın atladığı yer: ajanın geri dönüp sana soru sorması gereken görevler ve Model Context Protocol araçlarıyla yapılan görevler; sadece ekran dokunma değil hibrit yöntem test ediliyor. Bu tasarım, Qwen ekibinin neden cihaz-bulut koordinasyonunu mimarinin merkezine koyduğunu da açıklıyor.
Kim Ne Zaman Dokunabiliyor
Bugün kim kullanabiliyor sorusunun cevabı katmana göre değişiyor. Sıradan kullanıcı için yol telefon satın almak; Honor Magic9 serisi ve Robot Phone ilk durak. Geliştirici için yol Qwen Intelligence resmi sitesi ve Alibaba Cloud servisleri; benchmark’lar tamamen açık, MobileWorld’ü indirip Docker’da çalıştırıp kendi ajanını aynı görevlerde deneyebiliyorsun. Araştırmacı veya meraklı için iki ajan hakkında teknik raporlar ve araç çağrısı, mantık, arıza ve kurtarma anlarını gösteren kayıtlı demolar herkese açık; nadir bir şeffaflık. Alibaba’nın yol haritasında sırada kişiselleştirilmiş hafıza servisi, çok modlu etkileşim ve ortaklardan dikey ajanlar var; hafıza katmanı doğru çalışırsa araç, gerçekten yardım eden yardımcıya dönüşen eşik aşılıyor.
Dikkatten kaçan ama bence en önemli satır ajanların nasıl seçtiğiyle ilgili. Bu ajanlar düşün, koşu sırasında uygulamaları arayıp seçenekleri karşılaştırıyor ve senin için birini seçiyor; sen 10 sonuç listesi görmüyorsun, tek cevap görüyorsun. Google AI Overviews, ChatGPT, Perplexity ve Gemini’de zaten olan da bu: sonuç azaldıkça karar yükü sana değil modele kayıyor. Soru artık içeriğin sıralanıyor mu değil, biri sorduğunda yapay zeka seni seçiyor mu. Qwen Intelligence üç katmanda bu gerçeğe göre kurulmuş; alttaki mobil modele göre ayarlı temel, ortadaki araç yönetimini ve otomatik değerlendirmeyi tutan platform, üstteki ihtiyaca göre paketlenmiş ajanlar. Üretici ya tüm yığını alıyor ya da parça seçiyor, tıpkı işletim sistemi katmanı gibi.
Ne İzlemeli: Hafıza, Hız ve Seçim Ekonomisi
Kapanışta üç iz sürmeye değer. Bir, bunu sadece telefon hikayesi sanma; Kullanım Ajanı zaten bilgisayar ve tarayıcı görevlerini üstleniyor, planlama ve adım adım yönerge yazma becerisi her yerde işe yarayan disiplin. İki, API-öncelikli GUI-yedek desenine bak; kendi akışında da doğrudan bağlantı varken ekrana emanet etme, yedek yedek kalmalı çünkü yavaş ve kırılgan. Üç, hafıza katmanını takip et; proaktif yardımla kişiselleştirilmiş hafıza, çok modlu etkileşim ve dikey ajanlar boru hattında ve hafıza doğru oturduğunda her şey yeniden değişiyor. Önümüzdeki test 28 Eylül’deki Honor lansmanı ve açık benchmark’ların tekrarlanabilirliği; skor tablosu değil, 100’den fazla gerçek telefondaki tekrar bize asıl resmi verecek.
Videodaki anahtar anlar
- Sifir taps fikri — bir gezi neden sifir dokunus olmali
- Qwen Intelligence nedir, ne degildir — uygulama degil platform
- Uc ajan tanitimi — Planlayici dusunur, Kullanici yapar, Yaratici uretir
- Tek cevap ekonomisi — on sonuc degil bir secim
- Planner harness ve hafiza — iptal ucus yeniden planlama
- Gercek cihaz testi — 100 telefon 150 uygulama 400 gorev
AI yorumu
"Benim okumam şu: Alibaba ajan yarışını model büyüklüğüyle değil, telefonun içine yerleşme hızıyla kazanmaya oynuyor. Üç ajanlı paket, tek bir akıllı asistan vaadinden çok bir işletim sistemi katmanı gibi kurulmuş — hafıza, araç yönetimi ve cihaz-bulut dengesi tek pakette geliyor. Bu yüzden Honor hamlesi donanım iş birliğinden fazlası; modelin gerçek dünyada çalışıp çalışmadığını vitrine çıkaran bir canlı test."
AI değerlendirmesi
Güçlü taraf, videonun ve kaynakların ölçümü simülatörden çıkarıp gerçek cihazlara taşıması ve 100’den fazla telefon, 150’den fazla uygulama ölçeğinde iz toplaması; 77.05% MobilePA-Bench ve 82.1/92.2/97.5 üçlüsü tek skor değil, katmanlı bir kanıt. Açık dört benchmark ve Apache lisanslı MobileWorld, tekrarlanabilirlik vaadini ciddiye alan nadir şeffaflık.
Sınırlar ve sorular: Liderlik dar — Planlayıcı’da ikinciye fark küçük, Kullanım’da 90% iddiası kapsama koşuluna bağlı; hangi uygulama karmasında ve ağ/izin senaryosunda düştüğü rapor başlığında değil detayda gizli. Güvenlik ve gizlilik katı sınırlar olarak anılıyor ama izin, ödeme ve veri silme durdurma eşikleri denetim log’uyla gösterilmemiş. 3 saniyelik görsel hızı da tek cümle koşulunda, daha ağır çok adımlı düzenlemede ne kaldığı belirsiz.
Karşı tez ne der: Şüpheci okuma, tek cevap ekonomisinin rahatlık kadar risk olduğunu söyler — ajan senin için seçtikçe görünmez seçimler çoğalır ve yanlı ya da sponsorlu seçimin izi teke inen cevapta kaybolur. Ayrıca API-öncelikli sözü, uygulama tarafı API açmadıkça ekran otomasyonuna dönüyor; en kritik anlarda yine en kırılgan moda düşebilir ve marka sözü ile fiili deneyim ayrışır.
Pratik çıkarım: Telefonu olan için 28 Eylül sonrası Honor denemesi gerçek testi verir; geliştirici için Docker’da MobileWorld’ü aynı görevlerde koşmak ucuz ve dürüst bir ayna; ekip için ise API bağlantısı olan yerde ajana doğrudan yol verip ekran kontrolünü yedek tutmak, hafıza boru hattı gelene kadar en stabil kazanç. Skordan çok tekrar ve iz okuryazarlığı belirleyici olacak.
Kaynaklar
8 bağlantı; bunları kullanan başka yayımlanmış haber yok. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.
- @youtube.com YouTube — Alibaba Qwen Intelligence: 3 Mobil Ajan
- @gadgetpilipinas.net https://www.gadgetpilipinas.net/2026/09/alibaba-qwen-intelligence-agentic-phones/
- @alibabacloud.com https://www.alibabacloud.com/en/press-room/alibabacloudunveilsstrategicroadmaps?_p_lc=1
- @digitalphablet.com https://digitalphablet.com/ai/alibaba-launches-qwen-ui-agent-surpassing-gpt-5-6-and-claude-4-8/
- @honor.com https://www.honor.com/global/news/honor-magic8-china-launch/
- @pandaily.com https://pandaily.com/alibaba-qwen-intelligence-phone-agent-stack-honor-magic9
- @news.cocoloop.cn https://news.cocoloop.cn/en/2026/08/qwen-ui-agent-real-device/
- @techadvisor.com https://www.techadvisor.com/article/2249860/app-less-ai-phone-terrible-idea.html
alibaba qwen intelligence · honor magic9 · mobil ajan · apsara 2025 · mobileworld