论文

Hista 和 Numca:有效估计 LLM 强化学习的状态值

Hista and Numca: Estimate State Value Effectively for LLM Reinforcement Learning

模型训练强化学习

摘要

强化学习 (RL) 通过奖励信号直接优化模型行为来细化 大语言模型 (LLM)。虽然准确的状态值估计对于经典 RL 的稳定训练至关重要,但它仍然是 LLM 后训练 中尚未探索的挑战。在这项工作中,我们引入了状态值估计基准(SVEB)来评估现有 RL 框架内的状态估计,并表明 PPO 等标准方法中的批评者崩溃到粗略的组平均基线。为了解决这个问题,我们提出了两种技术:Numca,它利用数值跨度作为状态值估计的可分级里程碑;Hista,一个使用 LLM 的隐藏状态作为加权平均不相交轨迹采样及其返回的表示的框架。大量实验表明,这两种方法都能产生更准确的状态值估计,并增强不同 RL 算法和模型大小的训练性能,而不会产生大量计算开销。