论文
RetroAgent:通过回顾式双内在反馈从解题到演化
RetroAgent: From Solving to Evolving via Retrospective Dual Intrinsic Feedback
摘要
经过强化学习 (RL) 训练的基于大语言模型 (LLM) 的智能体在复杂的交互任务上表现出了强大的潜力。然而,标准强化学习范式更倾向于静态问题解决而不是持续适应:由于探索不足,智能体经常会收敛到次优策略,而学到的知识仍然隐含在参数中而不是显式检索,从而限制了有效的体验式学习。为了解决这些限制,我们引入了 RetroAgent,这是一个在线 RL 框架,它使智能体不仅可以通过解决问题,还可以通过进化来掌握复杂的交互环境。具体来说,RetroAgent 具有事后自我反思机制,可产生双重内在反馈:(1) 内在数字反馈,跟踪相对于先前尝试的增量子任务完成情况,奖励有希望的探索;(2) 内在语言反馈,将可重用的课程提炼到内存缓冲区中,通过我们提出的相似性和效用感知上置信界 (SimUtil-UCB) 策略检索,平衡相关性、效用和探索,以有效利用过去的经验。对四个具有挑战性的代理任务的两个模型系列进行的广泛实验表明,RetroAgent 显着优于现有方法,实现了最先进的结果 - 例如,在 ALFWorld 上超过组相对策略优化 (GRPO) 训练的代理 +18.3%,在 WebShop 上超过 +15.4%,在 Sokoban 上超过 +27.1%,在 MineSweeper 上超过 +8.9%,同时表现出强大的测试时间适应性和泛化能力分布外场景。
