论文

ARBITER:推理测试时采样中的轨迹盆地和多数投票失败

ARBITER: Reasoning Trajectory Basins and Majority Vote Failures in Test-Time Sampling

模型推理推理验证与自校正

摘要

当语言模型使用测试时采样时,它们会生成多个推理轨迹并通过多数票选择答案。我们证明这些轨迹不是独立的:对于给定的问题,它们集中在少数簇或推理池中,每个簇或推理池都由标准化的最终答案和达到该答案的解决方案定义。因此,多数投票会选择最稳定的盆地,而不是最准确的盆地,这会导致错误多数失败,即正确答案存在但被否决。我们引入了 ARBITER,这是一种与模型无关的方法,仅使用基础模型自己的采样输出、隐藏状态和派生证据来模拟流域之间的相互作用。大多数直接修正策略都会失败;相反,仲裁者在共识之上使用保守的附加证据。在其最简单的无参数形式中,ARBITER-Δ 向大多数先验添加了相同模型的证据,而 ARBITER-Enc 通过完整解决方案的隐藏状态的有界残差信号来增强这一点。在带有 Qwen3-4B 的 GSM8K 上,K=24 个样本的共识达到了 94% 左右的范围,而同池 top-2 预言机达到了 96% 左右的范围。 ARBITER 使用零外部信息恢复这些案例的子集。在三个模型系列和三个数学基准中,它产生了一致的收益,没有净负案例;例如,在 Llama-3.1-8B MMLU-HS-Math 上,它将准确度从中间 78% 范围提高到中间 82% 范围,恢复了大约 22% 的可用预言机净空,表明该净空可以从样本池本身部分恢复。