论文
EDGE:代理强化学习中引导探索的体验-蒸馏
EDGE: Experience-Distillation for Guided Exploration in Agentic Reinforcement Learning
摘要
具有基于结果的目标(例如 GRPO)的强化学习使基于 LLM 的代理能够解决复杂的长期任务,但嵌入在交互轨迹中的可重用探索模式在单次策略更新后基本上被丢弃。现有的经验增强方法在推理时检索历史指导,但它们应用经验时没有考虑策略的不断发展的能力,并创建对外部检索的持久依赖。我们提出了 EDGE(Experience-蒸馏 for Guided Exploration),这是一个框架,它将检索到的经验视为临时训练时间支架,并逐步将其好处内化到参数化策略中。具体来说,EDGE 将每个采样轨迹组划分为经验条件和无经验轨迹,以估计和仅承认正边际收益,而无需额外采样,然后通过反向 KL 目标在其自身的经验支持上将诱导行为提炼为基本策略。共同进化经验库进一步综合来自新兴故障模式的指导,并随着政策的发展修剪过时的条目。在基于实体、网络和搜索的 QA 任务中,EDGE 比强大的 RL 基线提高了 12.5 个点,并且在没有推理时间支架或专有反射器的情况下仍然有效。该代码可在 https://github.com/xvolcano02/EDGE 获取。