论文
教师的几个步骤大有帮助:针对代理 后训练 的经济高效的 同策略 数据增强
A Few Teacher Steps Go a Long Way: Cost-Efficient On-Policy Data Augmentation for Agent Post-Training
摘要
对于 LLM 智能体来说,受监督的 微调 不仅与教师标签的质量有关,还与这些标签所依赖的交互上下文有关。纯行为克隆使用完整的教师演示,从而在训练中看到的教师诱发的环境与测试时遇到的学生诱发的环境之间造成不匹配。最近的工作通过在学生所达到的上下文中询问教师来解决这种不匹配问题,通常对教师的延续进行越来越精细的过滤。相反,我们将 同策略 数据构建框架为预算分配问题:在匹配的监督资源下,教师的产出是否应该花在更多从头到尾的演示、更长的延续、结果过滤或更广泛的学习者引发的上下文覆盖上?我们通过轨迹采样策略、切换时间分布、延续范围、过滤规则和两个补充成本来形式化这个设计空间:过滤前生成的教师推理和为 SFT 保留的教师监督。在 HotpotQA、ALFWorld 和 Terminal-Bench-Dev 中,在学习者引发的环境中,有界的、未经过滤的教师延续在匹配的预算下比纯粹的行为克隆有所改进。在 HotpotQA 和 ALFWorld 上,我们运行完整的比较,几个步骤的延续匹配或超过成功过滤和关键上下文过滤的替代方案。我们的研究结果表明,与更长或更精心策划的教师完成任务相比,在学习者引发的环境中放置一些教师步骤可能是更具成本效益的监督分配。