论文
ComputerSD:计算机使用Agent的实时反馈在线自蒸馏
ComputerSD: Online Self-Distillation from Real-Time Feedback for Computer-Use Agents
摘要
在线训练使计算机使用Agent(CUA)能够通过与可执行环境的交互来改进。然而,现有的方法主要依赖于稀疏的结果奖励,这不为中间动作提供监督。按on-policy自蒸馏 (OPSD) 通过特权重新评分提供词元级学习信号,但将其直接应用于 CUA 在线训练会带来两个挑战:固定指导可能与学生当前状态不一致,指导引起的概率变化可能与步骤级正确性发生冲突。我们引入了 ComputerSD,这是一种用于 CUA 的在线自蒸馏方法,可将执行的 GUI 转换的实时反馈转换为政策学习的指导。经过微调的 GUI 分析器会在每次操作后生成指导和步骤级价值得分;指导提供了优先的背景,而分数则调节产生的 OPSD 信号。 ComputerSD 在完全异步的训练框架中联合优化词元级 OPSD 和轨迹级 GRPO。在 OSWorld-Verified 上,ComputerSD 在通用 Qwen3-VL-8B-Thinking 和专用 EvoCUA-8B 主干上分别比仅结果 GRPO 好 1.9 和 4.1 个百分点。分布外环境中的评估进一步支持了 ComputerSD 的通用性。这些结果证明了通过 CUA 在线自我蒸馏从实时反馈中学习的有效性。