论文
LatentGRM:以保留语义的潜空间压缩进行高效奖励评估
Judging in Latent Space: Efficient Generative Reward Modeling via Semantics-Preserving Compression
摘要
奖励建模通常需要对多个评估标准进行联合表示和推理,但逐个描述这个过程可能会产生大量的推理成本。最近关于潜在推理的工作表明,连续状态可以更紧凑地支持这种计算。我们引入 LatentGRM,一个基于语义分块、压缩和重建的潜在评估框架。通过使用标题引导评估的结构来指导压缩,LatentGRM 学习紧凑的连续轨迹,支持自主的成对判断,而无需生成文本评估。单独的解释器根据这些轨迹重建评估文本,提供压缩下保留的信息的离线视图。在匹配的训练数据和骨干网下,LatentGRM 在 4B 和 8B 尺度上实现了相对于显式监督微调 (SFT) 判断的有竞争力的总体偏好准确性。在四个基准域中,LatentGRM-8B 将评估轨迹压缩了 8.9--9.2 倍,并将总判断推理时间减少了 6.1--7.0 倍 投票@5。受控的标题干预表明,依赖于标准的偏好信息是通过潜在序列携带的。总之,这些结果表明,连续的潜在评估可以大大降低推理成本,同时保持竞争性判断质量。
