论文

UI-Venus-2技术报告

UI-Venus-2 Technical Report

智能体系统模型训练强化学习Agent 架构与控制循环Agentic RL

摘要

多模态 GUI 代理已成为数字任务自动化的一个有前途的范例,但由于有限的环境覆盖、脆弱的任务构建和不可靠的奖励验证,从面向基准的模型过渡到可靠的现实世界应用程序仍然具有挑战性。在这项工作中,我们提出了 UI-Venus-2,这是一种通用基础 GUI 代理,旨在通过统一的闭环推理操作框架跨移动、Web 和桌面环境进行操作。为了缩小实际部署的差距,我们共同扩展了三个关键维度:(1) 环境,将覆盖范围扩大到 170 多种多语言移动应用程序和本机桌面操作系统; (2) 任务,采用深度研究管道进行基于函数的指令生成; (3)验证,采用具有可视化关键点和多模型投票的迹级和样本级评估器,以确保训练时可靠的RL信号。此外,我们还集成了安全意识机制,以确保后续行动的受控执行。通过提供一个强大、高效和开源的基础,UI-Venus-2 推动该领域朝着适用于现实世界应用程序的更通用、可验证和自我反思的代理方向发展。

UI-Venus-2技术报告:论文配图
图1 图形用户界面(GUI-Venus-2)的性能。每个小组将UI-Venus-227B和UI-Venus-2-9B与一些选定的强基线进行比较。我们赞成在最接近现有任务子集和职档预算的基础上评价独立的端对端系统;来源报告的行动架可能仍然不同。移动世界公司在117项任务上只使用图形用户界面,50个步骤;WebVoyager公司使用更新的595-任务分割法;Odyssey公司使用200项任务的平均评分;金星-CAPTCHA公司在所有219个例子中都使用微传票@1;金星-Bench-GD公司使用英语教学微观平均精确度。 “*”表示结果由我们复制。