论文
Android Coach:通过单状态多动作提高在线代理训练效率
Android Coach: Improve Online Agentic Training Efficiency with Single State Multiple Actions
摘要
在线强化学习(RL)是增强 Android 代理能力的有效方法。然而,由于模拟器的高延迟和现有强化学习算法的样本效率低下,指导智能体通过在线交互进行学习的成本过高。我们确定了当前方法的一个基本限制:单状态单操作范例,它使用来自在线单向轨迹采样的一对一状态操作对来更新策略,却未充分探索每个昂贵的模拟器状态。在本文中,我们提出了 Android Coach,这是一种新颖的框架,它将训练范式转变为单状态多操作,允许代理针对单个在线状态采样和利用多个操作。我们通过学习估计动作值的价值评估器来实现这一点,而无需额外的模拟器开销。为了确保价值评估器成为可靠的教练,我们集成了一个过程奖励模型,并引入了一个基于平均价值评估器输出的分组优势估计器。大量实验证明了 Android Coach 的有效性和效率:与 UI-TARS-1.5-7B 相比,它在 AndroidLab 和 AndroidWorld 上的成功率提高了 7.5% 和 8.3%,并且在匹配的成功率下,训练效率比单状态单操作方法 PPO 和 GRPO 高出 1.4 倍。