论文

经自主评估的计算机使用智能体强化学习

Reinforcement Learning for Computer-Use Agents with Autonomous Evaluation

模型训练强化学习Agentic RL

摘要

计算机使用智能体(CUA)通过在图形用户界面内直接感知与行动执行高层用户目标。但CUA的强化学习仍然困难——因为开放式桌面环境很少提供可扩展、机器可读的奖励信号:任务成功常以视觉定位且难以用手工奖励函数或密集人工标注指明。我们提出RL微调框架——以自主视觉语言评估作为GUI智能体的可扩展监督信号。给定最终截图与原始指令——视觉语言模型在策略优化期间判断任务完成并提供终端反馈——无需任务特定启发式或人工标注。由于自主评估器不完美——我们将其反馈建模为带噪二元奖励通道——并为近端策略优化推导噪声校正的奖励估计器。跨macOSWorld、Windows Agent Arena与OSWorld的实验表明:校正后的评估器奖励超越零样本基线与原始评估器奖励——较零样本平均提升12.6个百分点、较原始评估器微调提升5.1个百分点。这些结果表明:当评估器噪声被显式建模并校正时——自主评估可作为GUI环境中RL的实用奖励信号。

经自主评估的计算机使用智能体强化学习:论文配图
图 1:自主评估奖励的偏差校正框架。