论文

AHEAD:面向Agentic RL的适应性后见之明与环境增强蒸馏

AHEAD: Adaptive Hindsight with Environment-Augmented Distillation for Agentic RL

模型训练强化学习RLVRAgentic RL

摘要

用强化学习训练多轮LLM智能体通常依赖轨迹级奖励,它给每一步分配均匀的优势,无法识别哪些决策导致了成功或失败。自蒸馏方法可以通过用特权信息增强RL来提供更细粒度的监督。然而,现有方法通常以不加区分的方式将同一类型的特权信息应用于每一步,忽视了一个关键的不对称性:常规步骤几乎不需要额外指导,而关键错误步骤需要环境反馈本身无法提供的纠正方向。我们提出AHEAD,一个步骤感知的框架,为不同步骤类型匹配不同的监督来源。教师在所有步骤上接收环境反馈作为有据可依的稠密信号,并额外在错误步骤上接收LLM生成的纠正提示,以提供环境反馈所缺乏的方向。该方法对标准GRPO算法的改动极小。在ALFWorld、WebShop和基于搜索的QA上,并跨三个模型规模,AHEAD提升了任务成功率(7B规模下较GRPO在ALFWorld上+13.3分、在WebShop上+11.0分),以更少的训练步数达到给定成功率,并且相比仅有结果奖励的RL和以往自蒸馏基线,能在更紧的交互预算内解决任务。

AHEAD:面向Agentic RL的适应性后见之明与环境增强蒸馏:论文配图
图2:Ahead概览。阶段1通过LLM分析器识别失败轨迹中的错误步骤。阶段2构建步骤感知的特权信息:常规步骤使用环境反馈,错误步骤使用环境反馈结合LLM纠正提示。阶段3通过比较策略在原始上下文与PI增强上下文下的对数概率,计算token级自蒸馏信号 δ_{t,ℓ},并将其转换为对GRPO优势的有界重加权。成功轨迹完全绕过PI流程,保留原始GRPO优势。