论文
用于测试时间缩放中最佳验证的粒度调节自适应计算效率
Granularity-Regulated Adaptive Computational Efficiency for Optimal Verification in Test-Time Scaling
摘要
测试时间扩展 (TTS) 已成为一种强大的范例,通过在推理时投入额外的计算来提高 大语言模型 (LLM) 的推理性能。 TTS 的核心组件是 \emph{verifier},它对候选解决方案进行选择或评分以指导搜索过程。虽然之前的工作已经探讨了验证的好处,但仍有一个基本问题尚未得到充分探索:\emph{给定计算预算下验证的最佳粒度是多少?}粗粒度结果奖励模型(ORM)和细粒度过程奖励模型(PRM)代表了两个极端,但两者都无法在所有机制中实现计算最优性。在本文中,我们建立了一个统一的理论框架,称为 \textbf{GRACE} (\underline{G}ranularity-\underline{R}egulated \underline{A}daptive \underline{C}computational \underline{E}fficiency),将最佳验证粒度描述为问题难度、验证者准确性和计算预算的显式函数。我们证明存在一个阶段转变:当计算预算很大或问题很困难时,细粒度验证占主导地位,而在低预算、容易出现问题的情况下,粗粒度验证是首选。我们的理论将 Best-of-$N$、波束搜索和步进级 MCTS 统一在一个帕累托最优框架内,并激发了一种自适应粒度策略,可证明实现计算性能帕累托前沿。 MATH-500、GSM8K 和 AIME 基准的实证结果证实了所有四个理论主张,我们的自适应策略在匹配计算时的准确度比固定粒度基线高出 3.1%。