精选今天0 投票
UI-Venus-2:跨越移动、网页与桌面的通用GUI智能体
多模态 GUI 智能体被视为数字任务自动化的新范式,但从基准测试走向真实世界应用仍面临重重挑战:环境覆盖不足、任务构建脆弱、奖励验证不可靠。在此背景下,Venus 团队发布了 UI-Venus-2,一个旨在统一操作移动、网页与桌面环境的通用基础 GUI 智能体。其核心是一个闭环的推理-行动框架,并围绕环境、任务和验证三个维度进行了规模化扩展。
三大关键扩展
环境覆盖:UI-Venus-2 将环境覆盖扩展至 170 多个多语言移动应用以及原生桌面操作系统,大幅拓展了智能体的应用范围。
任务构建:采用深度研究流程生成基于功能的指令,确保任务指令的准确性和多样性,从而提升训练数据的质量。
验证机制:引入轨迹级和样本级评估器,结合视觉关键点与多模型投票,为强化学习提供可靠的奖励信号,增强训练的有效性。
安全与开放
UI-Venus-2 还集成了安全感知机制,以控制关键操作的执行,确保智能体在真实世界中的行为安全可控。团队强调,该模型将作为开源基础模型发布,旨在推动 GUI 智能体朝着更通用、可验证、可自我反思的方向发展。
行业意义
当前,GUI 智能体多集中于单一环境或特定任务,而 UI-Venus-2 的跨平台统一框架,为数字任务自动化提供了更全面的解决方案。其强调的验证机制和安全性,也回应了业界对智能体可靠性的担忧。
该技术报告已提交至 arXiv(编号 2609.00028),更多细节可查阅原文。