论文
过度思考的形态:长推理轨迹中的回溯爆发
The Shape of Overthinking: Backtracking Bursts in Long Reasoning Traces
摘要
推理模型常生成长轨迹,其中有用的自我修正与无成效的修改难以区分。我们通过回溯动力学来研究这一区分:即长篇推理轨迹内部的局部重新考虑、撤回或重新推导。在6,000条Qwen3-8B的AIME轨迹上,我们标注片段级回溯严重度,并分析事件时序、归一化深度与局部爆发结构。我们发现,早期孤立的修复常与正确推理相容,而错误轨迹更常出现持续存在且在后期聚集的中度至重度回溯。跨语料库检验表明,在其他模型/领域对上也存在相同的定性不对称。过滤分析将该信号实例化为前缀因果的选择性早退策略:在浅层与中层深度,爆发感知过滤优于固定的基于长度的过滤,且仅使用前缀可获得的特征。适中的长度截断仍是强的完整轨迹基线,但爆发感知控制提供了一种可部署的机制,用于区分可恢复的修复与可能的不稳定。
