论文
从自身交互中学习如何行动:面向GUI Agent的在线自蒸馏
Learn How to Act from Your Own Interactions: On-Policy Self-Distillation for GUI Agents
摘要
图形用户界面(GUI)Agent通过与软件环境的多轮交互来完成复杂的用户指令,既需要逐步推理来引导动作,也需要长时程记忆来保留与任务相关的信息。近期的在线自蒸馏(OPSD)方法在GUI grounding——GUI Agent的一项基础子任务——上取得了强劲性能,这得益于特权条件自教师提供的密集token级监督。然而,将现有OPSD方法扩展到多轮GUI Agent,受到自教师有限的特权遵循能力和特权指导不足的制约。本文提出GUI-SD-v2,即GUI-SD的升级版本,它将OPSD从GUI grounding扩展到多轮GUI交互,并通过两阶段训练框架解决上述关键局限。具体而言,GUI-SD-v2首先通过联合优化在相同GUI状态下带与不带特权指导的rollout来增强特权遵循能力。此外,它通过特权条件自教师选择性地蒸馏针对具体步骤的推理与记忆指导,支持动作决策以及后续交互中任务相关信息的保留。在AndroidWorld和MobileWorld两个代表性GUI Agent基准上的大量实验表明,GUI-SD-v2优于现有OPSD基线,并在Pass@1与Pass@3成功率上持续超越所评测的最先进方法。代码与训练数据将公开发布。
