论文

HSRM:用于测试时验证的隐状态奖励模型

HSRM: Hidden-State Reward Models for Test-Time Verification

模型训练奖励建模与过程监督

摘要

大语言模型通常可以生成看似合理的数学推理轨迹,但在多个候选方案中可靠地识别正确的解决方案仍然是一个关键挑战。现有的测试时推理管道通常依赖于基于文本的验证器来重新读取每个生成的解决方案,从而使验证成为推理的昂贵组成部分。然而,之前的研究表明,LLM经常在其内部表征中编码与正确性相关的信号,包括意识到自己的答案何时可能是错误的。基于这一观察,我们引入了 HSRM,这是一种轻量级隐藏状态奖励模型,它通过直接读取生成器的内部表示而不是重新处理其文本来验证候选解决方案。 HSRM 在推理步骤边界从冻结的生成器中提取隐藏状态,并使用小型 Transformer 编码器对候选者进行排名。它是根据带有结果标签的自生成轨迹进行训练的,既不需要人工编写的过程监督,也不需要大型的预训练验证器。在四个数学推理基准中,HSRM 在 16 个生成器数据集设置中的 15 个中匹配或优于 55M 参数的纯文本能量验证器,同时仅使用大约 2M 参数,通过重用生成过程中已计算的表示来提供纯文本验证的有效替代方案。

HSRM:用于测试时验证的隐状态奖励模型:论文配图
图1 高分辨率和超低分辨率金属结构概览。在解码过程中,一个冷冻的大语言模型 产生了Ts,nTs,n} 及其最后一层隐藏状态 Hs,nHs,n}。带有2M参数的HSRM提取了处于推理步骤界限的隐藏状态,以形成紧凑的步级序列[S [S]。基于文本的核查者取回抽样的标牌,重新装配和重新装配它们,然后通过一个大得多的模型在全序[Sxn][S\times n]上运行一个前传。HSRM 重现在生成过程中已经计算好的演示, 避免了这一重新编码步骤 。