论文
论LLM智能体主动推理强化学习中的信息自锁
On Information Self-Locking in Reinforcement Learning for Active Reasoning of LLM agents
摘要
具有基于结果的奖励的强化学习 (RL) 在训练大语言模型 (LLM) 代理执行复杂推理任务方面取得了巨大成功。然而,在主动推理中,智能体需要策略性地提出问题来获取任务相关信息,我们发现经过强化学习训练的 LLM 智能体经常遭受信息自锁的困扰:智能体不再提出信息性问题,并且难以内化已经获得的信息。为了理解这种现象,我们将主动推理分解为两个核心功能:动作选择(AS),它通过查询确定观察流;信念跟踪(BT),它根据收集的证据更新代理的信念。我们表明,AS 和 BT 能力的不足将限制 RL 训练期间的信息探索。此外,探索不足反过来又阻碍了 AS 和 BT 的改进,形成了一个反馈循环,将智能体锁定在低信息状态。为了解决这个问题,我们提出了一种简单而有效的方法,通过注入易于获得的定向批评来重新分配学习信号,以帮助智能体摆脱自锁。对 7 个数据集的大量实验表明,我们的方法显着减轻了信息自锁,带来高达 60% 的改进。
