论文

变废为宝:对Agent执行轨迹重新标注已完成目标

Spinning Straw into Gold: Relabeling LLM Agent Trajectories in Hindsight for Successful Demonstrations

模型训练合成数据

摘要

大语言模型 代理在部分可观察的长视野环境中运行,其中获得监督仍然是主要瓶颈。我们通过利用现有 后训练 方法中忽视的监督来源来解决这个问题:Agent执行轨迹中嵌入的非预期但成功的目标。具体来说,我们引入了后见之明监督学习(HSL),其中辅助 LLM 审查每个完成的轨迹,并用代理实际实现的所有自然语言目标重新标记它。然后,HSL 将轨迹与其重新标记的目标配对,并将这些配对用于附加 微调。为了减轻重新标记数据的次优性,我们提出了两种 HSL 学习技术:不相关动作屏蔽和样本重新加权。我们的实验表明,HSL 非常灵活,并且与现有的 后训练 管道兼容。它改进了 SFT 和 DPO,在具有更多样化目标空间的长期任务上获得了更大的收益。此外,HSL 具有样本效率:在 ALFWorld 上,它超越了在完整数据集上训练的基线,同时仅使用了四分之一的 真值 演示。