在人们的日常印象里,AI助手的本事大多停留在"动嘴"——你问一句,它答一句。但最近,阿里千问团队把这件事整个倒了过来:它搭了一个由一百多台真实手机、一百五十多款应用组成的"练兵场",让模型自己动手去点、去滑、去输入,像给人上课一样把AI"军训"了一轮。
![]()
8月20日,阿里正式发布名为Qwen-UI-Agent的GUI智能体基座模型。说白了,就是让AI学会在每一块屏幕上"亲手干活"的底层大脑——手机、电脑、网页、甚至深度搜索界面,都在它的活动范围内。
![]()
为什么要"真机军训"?过去许多模型在模拟器里训练,就像在游戏厅练开车,一到真实马路就露馅。真实手机上的弹窗广告、UI误读、滑动不准,都可能让AI当场翻车。研究显示,模型失败的原因一半以上来自这类真实干扰,四成来自执行能力缺陷——找不到入口、反复循环、忘了进度。阿里的思路简单直接:与其在虚拟世界绕弯子,不如直接搬来真机当训练场。这和中国特殊生态也有关——国内App功能深、入口杂、弹窗多,"看图操作"难度成倍上升,用真实国产应用喂出来的模型,天然更懂这些"中国式屏幕"。
![]()
成绩单如何?在移动端MobileWorld评测中,Qwen-UI-Agent得分82.1%,超越GPT-5.6和Claude Opus 4.8;自建真机评测集MobileWorld-Real上成功率冲上92.2%;电脑端OSWorld-Verified也拿下79.5%。经过多轮强化学习,任务成功率提升7%以上,推理消耗的token反而减少两成多——干得更多,花的力气更少。阿里还推出27B、35B、4B等多个版本,用更小的模型靠真实数据换性价比。
![]()
和AI手机到底差在哪?这是很多人最大的疑问。市面上不少"AI手机"也在做端侧助手,能摘摘要、能修图、能对话。但Qwen-UI-Agent是基座模型,是能嫁接到任何现有设备上的"通用执行器",不挑品牌不挑系统,手机电脑网页都能接管,强调跨设备完整工作流——比如在手机上查航班、在电脑上做数据分析、最后生成一份报告给你。而多数"AI手机"的AI更像一个个独立小工具,需要使用者自己点开App、自己调功能。一个是请了个会办事的全能管家,一个更像是装了堆智能插件。用行内的话说,前者干的是"活",后者提供的更多是"话"。
![]()
当然,要让这类GUI智能体走进千家万户还有很长的路,安全是第一道坎。面对转账、支付密码等敏感操作,模型能否主动踩刹车?会不会被恶意网页诱导?阿里强调会对危险操作主动终止,但这道防线能否经得住真实考验,还需要时间验证。
![]()
从"能聊"到"能干",AI这一步跨越,或许比想象中更近。当AI真能替你在屏幕上把事一件件办成,那台手机姓不姓"AI",反而没那么重要了。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.