论文

UniOPSD:统一 Agentic 强化学习的结果和事后反馈

UniOPSD: Unifying Outcome and Hindsight Feedback for Agentic Reinforcement Learning

模型训练强化学习Agentic RL

摘要

强化学习已成为训练语言模型Agent的有效方法,但稀疏和延迟的结果奖励为跨长交互序列的信用分配提供了有限的指导。最近关于on-policy自蒸馏(OPSD)的工作通过评估特权训练时间背景下策略的抽样响应来提供补充监督。然而,我们的诊断表明,结果和事后反馈之间的积极平均一致性与当地的巨大分歧并存,这就提出了如何在每个决策中分配它们之间的影响力的问题。我们引入了 UniOPSD(统一按策略自蒸馏),它通过自适应本地信用仲裁来统一这些反馈源。 UniOPSD 根据环境回报和共享互动锚点的成功同行后见之明构建了可比较的信用估计。历史一致性决定了全局混合水平,而当前信号可用性和相对精度则调整每个源对单独决策的影响。事件级结果贡献被保留,并且有界词元调制细化了策略优化的融合步骤信用。借助 Qwen2.5-3B-Instruct 和 Qwen2.5-7B-Instruct,UniOPSD 的 ALFWorld 成功率分别为 $82.8\%$ 和 $83.6\%$,WebShop 成功率为 $75.0\%$ 和 $82.0\%$,Search-QA 合计准确率分别为 $45.3\%$ 和 $49.8\%$。在 3B WebShop 上,UniOPSD 比 SDAR 提高了 7.0 个百分点。我们的代码可在 https://github.com/Zenghuang-Fu/Uniopsd 获取