论文
通过互信息自我评估强化来利用和校准事后过程奖励
Utilizing and Calibrating Hindsight Process Rewards via Reinforcement with Mutual Information Self-Evaluation
摘要
为了克服基于 大语言模型 (LLM) 的智能体强化学习 (RL) 中稀疏奖励的挑战,我们提出了互信息自我评估 (MISE),这是一种 RL 范式,利用事后生成自我评估作为密集奖励信号,同时根据环境反馈对其进行校准。根据经验,MISE 使代理能够从密集的内部奖励中自主学习,补充稀疏的外部信号。从理论上讲,我们的工作为生成性自我奖励范式提供了第一个正式基础。我们证明,利用事后自我评估奖励相当于最小化将策略和代理奖励策略之间的互信息与 KL 散度项相结合的目标。然后,这种理论见解为我们的校准步骤提供了信息并证明了其合理性,该校准步骤积极地将这些奖励与最佳策略保持一致。大量实验表明,MISE 的性能优于强大的基线,使开源 LLM 的约 7B 参数能够在无需专家监督的情况下在验证中达到与 GPT-4o 相当的性能。