论文
AgentHER:用于LLM智能体轨迹重标注的Hindsight Experience Replay
AgentHER: Hindsight Experience Replay for LLM Agent Trajectory Relabeling
摘要
LLM 代理在大多数现实世界任务上都失败了——GPT-4o 在 WebArena 导航任务中成功率不到 15%,在 ToolBench 上成功率低于 55%(Zhou et al., 2024;Qin et al., 2024)——但每条失败的轨迹通常都会被丢弃,浪费了收集经验的主要来源。我们引入了 AgentHER,这是一个框架,它通过将 Hindsight Experience Replay(HER;Andrychowicz 等人,2017)原理应用于自然语言代理轨迹来恢复丢失的训练信号,以进行离线数据增强。关键的见解很简单:失败目标 A 的轨迹通常是某些可实现的替代目标 B 的正确演示。AgentHER 通过四阶段管道(失败分类、结果提取、LLM 引导的置信门控提示重新标记和数据打包)实现了这一想法,将丢弃的失败转换为高质量的 SFT、DPO 和 ShareGPT 训练数据,同时具有基于零成本规则和 LLM 判断的实现。在 WebArena(Zhou 等人,2024)和 ToolBench(Qin 等人,2024)上,AgentHER 在四个模型系列(GPT-4o、Qwen2.5-72B/7B、LLaMA-3.1-8B)中比仅成功的 SFT 提高了 7.1-11.7 个百分点,同时实现了 2 倍的数据效率——仅 50% 的成功演示与基线性能相匹配。从 1.5B 到 72B 参数(+5.8-9.2 pp)和迭代重新部署下的复合收益是一致的(额外回合+2.1 pp)。人工评估证实,在多位法官验证下,重新标记精度为 97.7%。