论文

任务进度蒸馏:用紧凑教师监督训练小型Agent

Learning to Act with Task Progress: Distilling Small Agents from Compact Teacher Supervision

模型优化智能体系统Agent 规划Agent Harness蒸馏

摘要

从大型模型演示中学习提供了一种训练小型Agent的方法,这些小型Agent可以完成重复任务,而无需在每一步调用大型模型。核心设计选择是从教师轨迹中保留哪些内容,其中包含推理、行动和有关任务进度的信息。我们引入了任务进度蒸馏(TPD),这是一种离线方法,它将每个演示的操作与描述当前任务阶段的简短标签配对。学生学习这些紧凑的目标,并通过对可接受的阶段-动作对进行联合评分来选择动作,这是确定性工具在环境中执行的。在 ALFWorld 上,经过 404 次演示训练的 1.7B 学生通过 TPD 或仅动作监督实现了 72.4% 的平均看不见的任务成功率,而使用约束动作选择的推理训练学生则达到了 48.3%。显式阶段在 200 次演示中提供了额外的好处,与仅采取行动的监督相比,成功率从 48.0% 提高到 67.7%。随着更多的演示,只采取行动的学生缩小了差距,两种方法都达到了 76.9\%(808) 示威活动。共享历史分析将 TPD 的部分局部优势与子目标之间移动时的更好决策联系起来,特别是从对象获取到处理。这些结果表明,紧凑的监督可以训练有效的小型任务Agent,而明确的任务进度可以在中间示范预算中提供额外的指导。

任务进度蒸馏:用紧凑教师监督训练小型Agent:论文原图
图 1:离线训练和闭环执行。 (a) 冻结注释器读取每个教师历史前缀,并将当前任务阶段与学生 SFT 的演示动作配对。 (b) 学生成绩 3|𝒜⁡(ht)|3|\mathcal{A}(h_{t})|阶段-动作候选者,并且安全带执行得分最高的对中的动作。接下来的输入包括动作和环境反馈;记录预测阶段仅用于分析。