论文

当更多思考反而有害:LLM测试时计算扩展中的过度思考

When More Thinking Hurts: Overthinking in LLM Test-Time Compute Scaling

模型推理测试时计算扩展

摘要

通过扩展思维链来扩展测试时计算已成为提升大语言模型推理的主流范式。然而,现有研究隐含地假设思考更长总能带来更好的结果。这一假设在很大程度上未经检验。我们系统地考察了随着计算预算增加,额外推理token的边际效用如何变化。我们发现,在更高预算下边际收益大幅递减,且模型会出现「过度思考」现象:扩展推理伴随着放弃此前正确的答案。此外,我们证明最优思考长度随问题难度而变化,说明统一分配计算并非最优。我们的成本感知评估框架表明,在中等预算处停止可以显著减少计算量,同时保持相当的准确率。