论文

超越答案的思考:评估大型推理模型中的有害过度思考

Thinking Past the Answer: Evaluating Harmful Overthinking in Large Reasoning Models

模型评测评测方法与指标

摘要

大型推理模型 (LRM) 通过增加测试时间计算生成显式的中间推理轨迹来提高性能,但较长推理始终有益的假设仍未得到充分检验。虽然最近的证据表明额外的推理可能会导致模型过度思考,但我们会问:“一旦模型得出了正确的答案,进一步的推理是否会完善解决方案,还是会偏离它?”为了研究正确性后的动态,我们引入了一种基于推理充分性的前缀级轨迹评估协议,定义了模型首先生成正确答案所需的最小推理预算。这使我们能够区分冗长的过度思考(额外的推理是多余但无害的)和有害的过度思考(持续的推理会破坏已经正确的轨迹)。从多模态基准开始,我们发现许多被认为是推理密集型的实例只需要很少的推理。此外,在第一个正确的前缀处停止可以将标准推理的准确性提高高达 21%,这表明当前模型不仅受到推理能力的限制,而且还受到无法在正确时间停止的限制。此外,虽然提前停止等常见的效率策略可以显着减少冗长的过度思考(高达 50%),但它们无法减轻有害的过度思考。故障分析表明,正确性偏差主要是由逻辑漂移和视觉重新解释造成的。最后,我们表明我们的发现可以推广到纯语言推理基准,强调有害的过度思考是一种更广泛的可靠性风险。代码可在 https://simonecaldarella.github.io/thinking-past-the-answer 获取。

超越答案的思考:评估大型推理模型中的有害过度思考:论文配图
图 5:代表性正确性偏差。每个示例都显示了一条轨迹,该轨迹首先在 τy\tau_{y} 处达到正确答案,但随后通过感知、计算或逻辑错误变为不正确的最终答案 tNt_{N}。下面有一个证据,代表推理模型的错误步骤。