论文
较大模型的优势:约束引导推理的首要地位
Where Larger Models Excel: The Primacy of Constraint-Guided Reasoning
摘要
较大的语言模型在推理基准上始终优于较小的语言模型,但这种差距背后的推理差异仍未得到充分探索。在数学、物理、化学和编程的基准测试中,我们观察到稳定的性能差距:在数据集上平均,Qwen3-32B 比 Qwen3-8B 好 6.43%,而 GPT-OSS-120B 比 GPT-OSS-20B 好 7.38%。为了研究这些收益背后的推理差异,我们开发了 AdvCluster,这是一个自动化框架,可以识别较大模型显示出稳定优势的问题,从较大和较小模型产生的配对推理轨迹中提取细粒度的优势描述,并通过语义聚类来组织它们,并在审阅者模型的指导下进行定量评估和选择。我们的分析产生了更大模型推理优势的系统分类,涵盖跨领域重复出现的常见优势和与特定领域相关的专业优势。在这些模式中,一个反复出现的主题是约束引导推理:较大的模型更擅长识别显式和隐式约束,将它们组织成结构化推理,并使用它们排除不可行的路径并验证中间步骤。