推理规模扩展能否提升推理忠实度?自一致性权衡的多模型分析
Does Inference Scaling Improve Reasoning Faithfulness? A Multi-Model Analysis of Self-Consistency Tradeoffs
摘要
自一致性已成为提升大语言模型在推理任务上准确率的流行技术。该方法很直接:生成多条推理路径,并通过多数投票选出最常见的答案。虽然这能可靠地提升准确率,但这些增益是否反映了推理质量的真正提升仍不清楚。我们研究了一个此前未被研究过的基本问题:推理规模扩展能否提升推理忠实度?我们在100道GSM8K数学推理问题上对四个前沿模型(GPT-5.2、Claude Opus 4.5、Gemini-3-flash-preview和DeepSeek-v3.2)开展了全面的实证研究。我们的分析采用bootstrap置信区间、McNemar配对检验和Cohen's d效应量来严格量化效应。结果揭示了各模型之间惊人的差异,挑战了关于自一致性的常见假设。GPT-5.2呈现预期模式:在N=5时准确率从78%提升到90%,忠实度保持相对稳定(0.540到0.510)。Claude Opus 4.5则截然不同:其准确率反而从78%降到74.3%,而在N=5时忠实度从0.270大幅跃升至0.891。DeepSeek-v3.2已达98%的准确率,呈现天花板效应,忠实度仅有适度提升(0.440到0.541)。Gemini-3-flash准确率从81%提升到86%,忠实度略有下降(0.260到0.212)。问题难度分析显示,GPT-5.2解决了82%的难题,同时只做错13%的简单题;相比之下,Claude做错了23%的简单题,这解释了其准确率下降。这些发现对从业者很重要:自一致性并非普遍有益,团队应在部署前测试自己的具体模型。我们发布了代码,并提供了应对这些权衡的实用建议。
