论文
发散-汇聚推理:通过结构化解答合成扩展测试时计算
Divergent-Convergent Reasoning: Scaling Test-Time Compute through Structured Solution Synthesis
摘要
测试时计算可以显著提升大语言模型(LLM)的推理性能,但额外的计算如何以及在何时有帮助仍知之甚少。我们研究发散-汇聚推理(DCR),一个简单的两阶段原语:先由探索阶段生成多个候选解答,随后进入汇聚的和解(reconciliation)阶段。我们给出三个核心结果。第一,即使单次和解步骤也能可靠地放大正确的少数报告:跨数据集,当正确的探索输出处于少数时——即多数投票失效的机制——DCR常能恢复正确答案。第二,我们提出递归DCR,一个自回归的和解系统,迭代分析分歧并分配额外的测试时计算。递归DCR取得高于固定计算基线的准确率——AIME 2024达93.3%、AIME 2025达92.0%——同时平均节省约27%的计算,证明有针对性的资源分配优于均匀扩展。第三,我们通过一个简单的免训练分散度指标分析探索输出之间的分歧。分散度揭示了分歧与测试时收益之间的结构化关系:在DCR有效的机制中,探索输出间更高的分歧与和解带来的更大准确率提升相关。这些结果共同表明,通常被视为噪声的分歧可以被系统地利用来改进测试时推理,并揭示了Agentic LLM系统的新兴扩展定律。
