阿里发布 Qwen-UI-Agent,主打让模型真正“会用”每一块屏幕
2026年8月20日 17:45·ithome
IT之家 8 月 20 日消息,据千问大模型官方公众号,阿里巴巴正式推出 Qwen-UI-Agent,一个以真实世界为中心的 GUI 智能体基座模型,涵盖移动端、电脑端、网页端以及深度搜索(DeepSearch)环境。
据介绍,Qwen-UI-Agent 在 GUI 任务上全面对标乃至超越业界旗舰模型:
移动端: MobileWorld 82.1%,分别领先 GPT-5.6 Sol、Claude Opus 4.8、Seed 2.1 Pro 12.0、14.6、8.9 个百分点;真机基准 MobileWorld-Real 92.2%,超越 Gemini 3.1 Pro、Claude Opus 4.8、GPT-5.6 Sol、Seed 2.1 Pro ;AndroidDaily 高达 97.5%,接近满分。
电脑端:OSWorld-Verified 79.5%,超越 GPT-5.5、Gemini 3.1 Pro、Seed 2.1 Pro;OSWorld-v2 Partial 分数 40.0%,同时相比基线节省 58% 执行步数。
浏览器 & DeepSearch:WebArena 73.6%,位列所有对比模型第一;BrowseComp-ZH 75.0%。
GUI Grounding:ScreenSpot-Pro 81.5%,在其余 4 个 grounding 评测基准也全部刷新 SOTA。
通用能力:通用和 Agentic 能力全面保持或超越训练基座模型,并在这两类任务上大幅领先 GUI 专用模型,从容应对真实世界的长尾需求。

Qwen-UI-Agent 搭建覆盖 100+ 台真实手机、150+ 应用的真机移动环境,用于任务构建、轨迹采集、模型训练与评测,并自建 MobileWorld-Real 真机基准 (400+ 任务、100+ 应用),打通“从模拟到真实”的最后一公里。
Prompt: 我今天约了朋友去天目里喝咖啡,帮我在高德搜索查看详细地址,打开大众点找附近 1 公里内的咖啡馆,找人气最高的那家记下店名,再去小红书总结前五条笔记,看看大家推荐这家店的哪款咖啡。

Prompt: 下周三我从北京回来,帮我看一下 12306 最早到杭州西的那班高铁几点到。然后查一下杭州西坐地铁到阿里巴巴西溪园区要多久,算一下我几点能到公司。最后在钉钉安排一个到达后整点的会议。主题写 " 出差归来项目同步 ",参会人选我和张三。开一个小时,设置提前 5 分钟提醒。

Prompt: 在手机相册中找到所有收据,将它们移动到远程桌面上的 receipts 文件夹,按日期重命名,并在该文件夹中创建一个 Excel 文件汇总账单。

Qwen-UI-Agent 将安全判断贯穿任务执行全过程:面对违法或高风险请求,它会不执行任何界面操作,直接拒绝并终止任务;面对支付、数据删除、隐私授权等敏感场景,则会在关键步骤主动停手,向用户说明情况,待获得明确确认后再继续。危险请求不执行,敏感操作不擅自决定,让模型既能执行,也懂得何时停手。
GUI 操作之外,模型还能直接执行命令行操作,并在单次决策中批量输出多个动作。在电脑任务中,CLI 动作占比近半,约 40% 动作以 batched actions 形式输出,大幅缩短执行轨迹、拓展能力边界、提升执行效率。比如跨网站调研产品、核对价格,生成比价方案。
其支持在超过 100 步的超长轨迹上进行在线 RL 训练,约 10000 个并发环境同时 rollout,配合模型自适应课程学习,持续攻克长程任务。
IT之家附上有关链接如下:
广告声明:文内含有的对外跳转链接(包括不限于超链接、二维码、口令等形式),用于传递更多信息,节省甄选时间,结果仅供参考,IT之家包含外链的文章均包含本声明。

