论文
任务进度蒸馏:用紧凑教师监督训练小型Agent
Learning to Act with Task Progress: Distilling Small Agents from Compact Teacher Supervision
摘要
从大型模型演示中学习提供了一种训练小型Agent的方法,这些小型Agent可以完成重复任务,而无需在每一步调用大型模型。核心设计选择是从教师轨迹中保留哪些内容,其中包含推理、行动和有关任务进度的信息。我们引入了任务进度蒸馏(TPD),这是一种离线方法,它将每个演示的操作与描述当前任务阶段的简短标签配对。学生学习这些紧凑的目标,并通过对可接受的阶段-动作对进行联合评分来选择动作,这是确定性工具在环境中执行的。在 ALFWorld 上,经过 404 次演示训练的 1.7B 学生通过 TPD 或仅动作监督实现了 72.4% 的平均看不见的任务成功率,而使用约束动作选择的推理训练学生则达到了 48.3%。显式阶段在 200 次演示中提供了额外的好处,与仅采取行动的监督相比,成功率从 48.0% 提高到 67.7%。随着更多的演示,只采取行动的学生缩小了差距,两种方法都达到了 76.9\%(808) 示威活动。共享历史分析将 TPD 的部分局部优势与子目标之间移动时的更好决策联系起来,特别是从对象获取到处理。这些结果表明,紧凑的监督可以训练有效的小型任务Agent,而明确的任务进度可以在中间示范预算中提供额外的指导。
