思考多少才够?量化并理解LLM推理中的冗余
How Much Thinking is Enough? Quantifying and Understanding Redundancy in LLM Reasoning
摘要
具备推理能力的大语言模型通过输出冗长的思维链来求解难题,在延迟、GPU时间与能耗方面付出高昂代价。粗略检视其轨迹即可发现大量的重新表述、验证与循环式自我反思,然而这些深思之中究竟有多少真正必要,既从未在大规模上被测量过,也从未从第一性原理得到解释。本文弥合了这两重空白。我们直接以推理模型自身来形式化推理冗余:一条正确轨迹的冗余度,是其末尾分段步骤中可被截断的最大比例——截断后强制 $π$ 终止思考并给出最终答案,模型仍能产出正确答案。跨四个前沿推理模型与两个数学基准的大规模量化表明,步骤级冗余始终很高——在我们研究的8个(模型,基准)条件中介于61%与93%之间,且在八个条件中的六个里,中位关键前缀仅等于单个分段步骤——该发现对不同裁判家族的选择是稳健的;此外,尽管在MATH-500上 $ρ$ 随问题难度上升而下降,但即便在最难的Level-5问题上,四个模型依然保持显著冗余($ρ\in [46\%, 85\%]$)。我们随后证明,这种冗余是与长度无关的结果奖励(length-agnostic outcome rewards)的结构性后果,而非特定模型的产物:在任何此类奖励下,不存在最优的有限期望停止时间。该结论无论对何种强化学习算法、基座模型、数据分布,也无论策略是经由强化学习还是蒸馏获得,均成立;因此,过度思考并非可以在个别模型中打补丁修复的缺陷,而是当前推理模型训练方式的一种结构性属性。代码:https://github.com/zhiyuanZhai20/how-much-thinking-is-enough