论文
仅在需要时进行推理:通过模型内部不确定性进行高效的生成奖励建模
Reason Only When Needed: Efficient Generative Reward Modeling via Model-Internal Uncertainty
摘要
生成奖励模型(GRM)的最新进展证明了其通过思想链(CoT)提示增强 LLM 推理能力的潜力。尽管取得了这些成果,GRM 的现有实施仍面临两个关键限制。首先,CoT 提示不加区别地应用于所有输入,无论其固有的复杂性如何。这给需要快速、直接推理的任务带来了不必要的计算成本。其次,现有方法主要依靠基于投票的机制来评估 CoT 输出,这在评估推理质量时往往缺乏粒度和精度。在本文中,我们提出了 E-GRM,一种基于模型内部不确定性的高效生成奖励建模框架。 E-GRM 利用并行模型生成的收敛行为来估计不确定性,并仅在需要时选择性地触发 CoT 推理,而不依赖于手工制作的特征或任务相关信号。为了提高奖励保真度,我们引入了一种轻量级判别评分器,通过混合回归排序目标进行训练,以提供推理路径的细粒度评估。多个推理基准的实验表明,E-GRM 显着降低了推理成本,同时持续提高了答案准确性,证明模型内部不确定性是高效推理感知奖励建模的有效且通用的信号。