论文
EvoCUA-1.5:多轮计算机使用智能体的在线强化学习
EvoCUA-1.5: Online Reinforcement Learning for Multi-turn Computer-Use Agents
摘要
计算机使用智能体必须经与部分可观测的多模态桌面环境的反复交互解决长程任务。尽管模仿学习与离线轨迹精炼提供了强先验,静态轨迹无法覆盖真实计算机使用的因果反馈回路:每个动作都会改变屏幕状态、未来动作空间与恢复选项。EvoCUA-1.5把自进化计算机使用智能体从离线经验学习扩展到在线强化学习:策略与可执行沙箱环境交互、从可验证任务结果改进。该设定下的在线RL不止于直接复用单轮语言RL配方:多轮交互带来上下文管理的观测、稀疏终端奖励、变长轨迹与缓慢的环境反馈。EvoCUA-1.5以四项组件应对:步级策略优化(STEPO)——在分解为步级样本后保持轨迹级优势平衡;可验证合成任务上的策略感知过滤与通过率校准;动态三自适应课程(DTAC)——组合可学习任务、困难正例回放与受控的不可行任务暴露;以及带陈旧性控制与小组批处理的全异步RL基础设施。实验显示这些组件改善训练稳定性与下游表现:EvoCUA-1.5在OSWorld-Verified取得63.2%成功率,超过可比的32B/35B级开放权重基线,甚至接近参数量显著更大的模型。总体而言,EvoCUA-1.5为多轮计算机使用智能体的在线RL扩展提供实用框架。
