论文

ENVS:面向长程GUI智能体的环境原生验证搜索

ENVS: Environment-Native Verified Search for Long-Horizon GUI Agents

模型训练强化学习合成数据Agentic RL

摘要

随多模态智能体从界面理解走向真实软件控制——在活体桌面环境中的成功轨迹发现成为关键挑战。GUI任务需要长程的精确鼠标键盘动作序列——而反馈稀疏、延迟且经VM rollout获取成本高。我们提出环境原生验证搜索(ENVS)——训练时搜索-过滤管线:在策略优化前用环境构建经验证的监督——它在活体OSWorld VM中按行为不同的GUI动作分支、验证成功的叶子、并从全局均衡的步级监督训练。为评估真实桌面中断下的鲁棒性——我们还介绍OSWorld-Noisy——可恢复桌面中断的动态基准——保留原始任务同时测试智能体能否在活体扰动下重新聚焦、关闭、等待或恢复。在300任务OSWorld池上——ENVS在原始评估达30.3 pass@8、OSWorld-Noisy达29.0——超越匹配的ARPO式在线RL——同时把算力从184-192降到138-153 GPU小时;仅用30%搜索数据——ENVS达27.0 pass@8——超过从基座出发的ARPO。从噪声环境训练还更好保持辅助基准上的视觉推理能力——包括OSWorld-G Refusal(16.7对1.9)与BLINK功能对应(26.2对23.1)。

ENVS:面向长程GUI智能体的环境原生验证搜索:论文配图
图 1:ENVS 将数据收集与模型训练解耦 (a),与在线 RL (b) 相比,以更低的计算量达到更高的准确度; OSWorld-Noisy 注入人性化的中断来测试稳健性 (c)。