论文

论LLM智能体主动推理强化学习中的信息自锁

On Information Self-Locking in Reinforcement Learning for Active Reasoning of LLM agents

模型训练强化学习Agentic RL

摘要

具有基于结果的奖励的强化学习 (RL) 在训练大语言模型 (LLM) 代理执行复杂推理任务方面取得了巨大成功。然而,在主动推理中,智能体需要策略性地提出问题来获取任务相关信息,我们发现经过强化学习训练的 LLM 智能体经常遭受信息自锁的困扰:智能体不再提出信息性问题,并且难以内化已经获得的信息。为了理解这种现象,我们将主动推理分解为两个核心功能:动作选择(AS),它通过查询确定观察流;信念跟踪(BT),它根据收集的证据更新代理的信念。我们表明,AS 和 BT 能力的不足将限制 RL 训练期间的信息探索。此外,探索不足反过来又阻碍了 AS 和 BT 的改进,形成了一个反馈循环,将智能体锁定在低信息状态。为了解决这个问题,我们提出了一种简单而有效的方法,通过注入易于获得的定向批评来重新分配学习信号,以帮助智能体摆脱自锁。对 7 个数据集的大量实验表明,我们的方法显着减轻了信息自锁,带来高达 60% 的改进。

论LLM智能体主动推理强化学习中的信息自锁:论文配图
图 1:信息自锁 (SeL) 及其缓解措施的总体说明。 (b,a,o)(b,a,o) 表示智能体的内部信念、其选择的行动以及每轮的反馈结果。在基于结果的普通强化学习(上)下,智能体可能会陷入自锁状态:信念跟踪不足会掩盖信息查询的贡献,从而导致信用分配错位。我们的 AReW(底部)通过定向批评引入了优势重新加权,纠正学习信号并帮助减轻主动推理中的 SeL。