论文

细化优于重采样:LLM推理的测试时自校正

Refining Over Resampling: Test-Time Self-Correction for LLM Reasoning

模型推理推理验证与自校正

摘要

测试时间扩展提升了大语言模型的推理能力,但单纯的宽泛采样往往会出现边际效益递减的问题:新的迭代通常重复已有答案模式,而不是增加有用推理多样性。基于验证器的选择提供了一个替代方案,但其性能依赖于外部奖励模型的校准。我们提出了一种无需验证器的广度-深度细化框架,利用测试时间计算来同时探索和改进候选解决方案。该方法通过迭代自我批评和自我校正的方式对多个独立推理迭代进行采样,并通过多数表决法将精炼后的答案聚合起来。广度保留了初始尝试的多样性,而深度则在聚合之前修复局部推理错误。在AIME24、AIME25、AMC、奥林匹克bench和MATH500等开放权重模型上,我们的方法在贪婪解码、多数表决、基于验证器的最佳N个解、束搜索和前瞻解码等多个开放权重模型上均优于这些方法。例如,在Qwen2.5-1.5B上,从最强的验证器基准到MATH500上的准确率从最强的验证器基准增加到58.0%,AMC上的准确率从25.0%增加到32.5%。这些结果表明,测试时间计算在用于细化采样轨迹时比依赖于验证器选择更为有效。

细化优于重采样:LLM推理的测试时自校正:论文配图
图 2:所提出的广度深度细化框架概述。每个 NN 推出都通过 DD 深度层进行细化,每个阶段由三个阶段组成:(1) 推理延续 (gi(d)g_{i}^{(d)}) by πθ𝖦\pi_{\theta}^{\mathsf{G}},(2) 自我批判 (ci(d)c_{i}^{(d)}) πθ𝖢\pi_{\theta}^{\mathsf{C}},以及(3)由 πθ𝖱\pi_{\theta}^{\mathsf{R}} 进行自校正(ri(d)r_{i}^{(d)})。终端跟踪通过多数投票来聚合,以产生最终答案 a^\hat{a}。无需验证员或额外培训。