论文

HINT-SD:针对长期代理的有针对性的事后自我 蒸馏

HINT-SD: Targeted Hindsight Self-Distillation for Long-Horizon Agents

摘要

使用强化学习训练长视野 LLM 智能体具有挑战性,因为稀疏的结果奖励揭示了任务是否成功,但不能揭示哪些中间操作导致了结果或应该如何纠正它们。最近的方法通过从回合级动作输出信号生成奖励或文本提示,或通过使用反馈调节的自我 蒸馏 来缓解这个问题。然而,当许多中间回合已经成功或中立时,在每个回合生成反馈效率很低,并且在固定或未对准的回合应用反馈通常无法监督导致失败的操作。为了弥补这一差距,我们提出了 HINT-SD,这是一个有针对性的自我 蒸馏 框架,它使用全轨迹后见之明来选择与失败相关的行动,并将反馈条件 蒸馏 仅应用于目标行动范围。 BFCL v3 和 AppWorld 上的实验表明,我们的方法平均优于密集每轮反馈基线高达 13.60 个百分点,同时每个训练步骤的时间减少了 2.26$\times$,这表明选择提取位置是有效且高效的长视野智能体训练的关键。