阿里巴巴正式推出了以真实世界为中心的 GUI 智能体基座模型 Qwen-UI-Agent。该模型全面覆盖了移动端、电脑端、网页端以及深度搜索环境,旨在打破传统模拟测试的局限,让模型真正具备在复杂真实设备上无缝操作的能力。

image.png

全面超越行业旗舰的综合性能

在各项权威测试与实际环境中,Qwen-UI-Agent 展现出了强劲的实力:

  • 移动端表现:在 MobileWorld 测试中斩获82.1% 的高分,领先多个主流国际旗舰模型;而在自建的百台真机基准 MobileWorld-Real 上,成功率高达92.2%,在 Android Daily 中更是接近满分。
  • 电脑端表现:在 OSWorld-Verified 中取得了79.5% 的成绩,同时在多项任务中相比基线大幅节省了执行步数。
  • 网页与通用能力:在 WebArena 网页测试中位列所有对比模型第一,且其通用和 Agentic 能力全面超越训练基座模型,能够从容应对长尾需求。

从模拟走向真实的真机环境

为了打通“从模拟到真实”的最后一公里,Qwen-UI-Agent 搭建了覆盖100多台真实手机、150多个应用的真机移动环境,用于任务构建、轨迹采集及模型训练,并推出了包含400多个任务的 MobileWorld-Real 真机基准,使研发团队能够根据真机成功率进行精准选型。

image.png

兼顾高效指令与安全管控

在功能特性上,该模型不仅支持常规的 GUI 界面操作,还能直接执行命令行操作,并在单次决策中以批量动作输出,大幅缩短了执行轨迹并提升了效率。同时,它具备完善的全过程安全判断机制:面对违法或高风险请求,它会直接拒绝并终止任务;而在涉及支付、数据删除、隐私授权等敏感场景时,则会在关键步骤主动停手,等待用户确认后再继续。

此外,该模型支持在超过100步的超长轨迹上进行在线强化学习训练,配合自适应课程学习,持续攻克高难度的长程任务。

项目主页:https://tongyi-mai.github.io/Qwen-UI-Agent/