论文
PRO-CUA:计算机使用智能体的过程奖励优化
PRO-CUA: Process-Reward Optimization for Computer Use Agents
摘要
计算机使用智能体(Computer Use Agent,CUA)在自动化复杂数字工作流方面展现出强大潜力,但其训练仍受制于昂贵的真实环境交互和有限的高质量监督。现有的过滤行为克隆流水线存在模仿瓶颈,包括与专家示范之间的分布偏移以及缺乏负向学习信号。与此同时,标准的轨迹级强化学习则受困于稀疏奖励、模糊的贡献归因以及长时程GUI交互的高昂基础设施成本。本文提出PRO-CUA,一种以迭代式步级强化学习训练CUA的过程奖励优化框架。PRO-CUA将同策略环境交互与策略优化解耦:当前策略通过真实回放采集状态,为每个状态生成多样的候选动作,从过程奖励模型(Process Reward Model,PRM)接收步级反馈,并以组相对优势进行优化。这一设计无需依赖黄金答案或离线专家轨迹即可实现密集而灵活的贡献归因,同时通过在智能体自身的执行状态上训练来降低分布偏移。在真实网页基准上的实验证明了PRO-CUA的有效性以及PRM引导的步级训练的可靠性。
