论文

LatentGRM:以保留语义的潜空间压缩进行高效奖励评估

Judging in Latent Space: Efficient Generative Reward Modeling via Semantics-Preserving Compression

模型训练模型推理模型评测奖励建模与过程监督推理策略与问题分解评测方法与指标

摘要

奖励建模通常需要对多个评估标准进行联合表示和推理,但逐个描述这个过程可能会产生大量的推理成本。最近关于潜在推理的工作表明,连续状态可以更紧凑地支持这种计算。我们引入 LatentGRM,一个基于语义分块、压缩和重建的潜在评估框架。通过使用标题引导评估的结构来指导压缩,LatentGRM 学习紧凑的连续轨迹,支持自主的成对判断,而无需生成文本评估。单独的解释器根据这些轨迹重建评估文本,提供压缩下保留的信息的离线视图。在匹配的训练数据和骨干网下,LatentGRM 在 4B 和 8B 尺度上实现了相对于显式监督微调 (SFT) 判断的有竞争力的总体偏好准确性。在四个基准域中,LatentGRM-8B 将评估轨迹压缩了 8.9--9.2 倍,并将总判断推理时间减少了 6.1--7.0 倍 投票@5。受控的标题干预表明,依赖于标准的偏好信息是通过潜在序列携带的。总之,这些结果表明,连续的潜在评估可以大大降低推理成本,同时保持竞争性判断质量。

LatentGRM:以保留语义的潜空间压缩进行高效奖励评估:论文原图
图 2:LatentGRM 训练和推理。第一阶段将语义边界编码为词汇空间目标并训练后缀重建;第二阶段提炼出自主的潜在判断。离线解释器根据保存的轨迹重建评估。