论文

熵质心作为测试时间缩放的内在奖励

Entropy Centroids as Intrinsic Rewards for Test-Time Scaling

模型推理测试时计算扩展

摘要

扩大 大语言模型 测试时计算的一种有效方法是对多个响应进行采样,然后选择最佳的一个,就像 Grok Heavy 和 Gemini Deep Think 中那样。现有的选择方法通常依赖于外部奖励模型,这需要训练强大的奖励模型并引入额外的计算开销。作为替代方案,以前的方法已经探索了内在信号,例如置信度和熵,但这些信号由于简单的聚合而充满噪声。在这项工作中,我们观察到高熵标记在推理过程中倾向于聚集成连续的组,从而提供比单个标记更稳定的模型不确定性概念。这些簇共同揭示了整个推理过程中模型不确定性的时间模式。受这一观察的启发,我们建议使用不确定性的时间结构作为内在奖励。为此,我们首先将段级不确定性的基本单位形式化为高熵阶段(HEP),这是一个从高熵标记开始并在连续低熵标记出现时结束的可变长度段。然后,受物理学中质心概念的启发,我们将熵质心定义为沿轨迹的所有 HEP 的加权平均位置。直观上,较低的质心表明早期探索,然后是自信的生成,我们发现这通常对应于较高的响应质量。基于这一见解,我们提出了最低质心方法,该方法在多个候选者中选择具有最低熵质心的响应。对数学、代码生成、逻辑推理和代理任务(从 14B 到 480B 的模型规模)的实验表明,最低质心始终优于现有基线,并随着模型大小的增加提供稳定的增益。代码可在 https://github.com/hkust-nlp/entropy-centroid 获取。