论文

LLM 作为评审团:跨模型共识可以超越 LLM 推理的过程奖励模型

LLMs as a Jury: Cross-Model Consensus Can Outperform Process Reward Models for LLM Reasoning

模型推理推理验证与自校正

摘要

从候选推理链池中选择正确答案是测试时间扩展的引擎,但每个标准选择器都有一定的成本:自一致性继承了它重新采样的单个模型的错误,训练有素的奖励模型需要标记数据,并且在分布外的传输效果很差。我们研究第三个信号,在推理时自由:跨模型共识,即独立训练的模型(每个模型解决一次问题)就最终答案达成一致的程度。我们将小组视为 LLM 陪审团,其中验证信号是协议本身的结构,没有模型对他人的工作进行评分。在七个基准测试中,它选择的正确答案比自我一致性更好,也比为自己的候选者评分的模型好得多:在竞争数学上,它缩小了与预言机选择器的全部差距,而自我评分几乎没有缩小任何差距。其机制是错误去相关:独立训练的模型会犯不同的错误,因此它们的错误答案会分散,而正确的答案会积累一致。我们通过以封闭形式导出的无参数定律来精确实现这一点,该定律根据三个测量的面板统计数据预测共识准确性,平均绝对误差为 0.03,并暴露了该方法的上限:模型共享误解的共享误差下限,在数学上接近于零,但在科学上却并非微不足道。针对涵盖歧视、结果和生成奖励模型的四名训练有素的验证者,免费的 LLM 陪审团与数学训练领域内最强的验证者相匹配,并且是该领域之外的最佳选择者。因此,跨模型共识是我们可以提前表征的验证器:一条规定何时信任它的法律,以及一个标记不能信任的下限。