论文

RetroAgent:通过回顾式双内在反馈从解题到演化

RetroAgent: From Solving to Evolving via Retrospective Dual Intrinsic Feedback

模型训练强化学习RLVRAgentic RL

摘要

经过强化学习 (RL) 训练的基于大语言模型 (LLM) 的智能体在复杂的交互任务上表现出了强大的潜力。然而,标准强化学习范式更倾向于静态问题解决而不是持续适应:由于探索不足,智能体经常会收敛到次优策略,而学到的知识仍然隐含在参数中而不是显式检索,从而限制了有效的体验式学习。为了解决这些限制,我们引入了 RetroAgent,这是一个在线 RL 框架,它使智能体不仅可以通过解决问题,还可以通过进化来掌握复杂的交互环境。具体来说,RetroAgent 具有事后自我反思机制,可产生双重内在反馈:(1) 内在数字反馈,跟踪相对于先前尝试的增量子任务完成情况,奖励有希望的探索;(2) 内在语言反馈,将可重用的课程提炼到内存缓冲区中,通过我们提出的相似性和效用感知上置信界 (SimUtil-UCB) 策略检索,平衡相关性、效用和探索,以有效利用过去的经验。对四个具有挑战性的代理任务的两个模型系列进行的广泛实验表明,RetroAgent 显着优于现有方法,实现了最先进的结果 - 例如,在 ALFWorld 上超过组相对策略优化 (GRPO) 训练的代理 +18.3%,在 WebShop 上超过 +15.4%,在 Sokoban 上超过 +27.1%,在 MineSweeper 上超过 +8.9%,同时表现出强大的测试时间适应性和泛化能力分布外场景。

RetroAgent:通过回顾式双内在反馈从解题到演化:论文配图
图 1:(a) RetroAgent 框架概述。每次发作后,智能体都会通过自我反思机制分析其轨迹,以产生双重内在反馈,从而能够从过去的经验中进行有效的学习。 (b) 从 Qwen-2.5-7B-Instruct 初始化,RetroAgent 大大优于 GRPO 训练的基线(Shao 等人,2024b),并在四个具有挑战性的代理基准上实现了 SOTA 结果。