论文
先行动,后推理:通过参考条件逆动力学加速多轮智能体的按策略蒸馏
Act First, Reason Later: Accelerating On-Policy Distillation for Multi-Turn Agents via Reference-Conditioned Inverse Dynamics
摘要
on-policy蒸馏 (OPD) 训练多轮语言Agent,并在教师对学生生成的响应进行密集监督的情况下进行训练。然而,标准的“思考然后行动”部署需要在每个简短的行动之前进行冗长的推理,从而延迟了环境转换和经验收集。生成操作会直接减少这种延迟,但会降低rollout质量。为了解决这个问题,我们提出了 ActFirst-OPD,一种先行动、后推理的训练框架,它将环境交互与完整响应的生成分离。学生使用其当前交互上下文和参考下一个观察结果,通过参考条件逆动力学推断并执行动作,并在结果转换偏离参考轨迹时切换到自主下一个动作预测。根据收集的交互上下文,学生异步生成完整的“思考然后行动”响应,以进行标记级教师的监督。针对 0.6B、1.7B 和 4B 参数 Qwen3 学生的实验表明,与 Vanilla OPD 相比,ActFirst-OPD 在 ALFWorld 上的平均挂钟训练加速为 $2.3\times$,在 WebShop 上为 $1.8\times$,在 ScienceWorld 上为 $4.9\times$。它在九个基准模型设置中的八个中的平均任务成功率方面匹配或超过所有比较的 OPD 基线。这些结果表明,推理不需要在多轮Agent蒸馏过程中阻止作用。