论文

长思维链中的思考陷阱:可度量研究与陷阱感知自适应重启

Thinking Traps in Long Chain-of-Thought: A Measurable Study and Trap-Aware Adaptive Restart

模型推理推理验证与自校正

摘要

通过长思维链(Long-CoT)扩展测试时计算显著增强了推理能力,但延长的生成并不保证正确:在早期做出错误承诺后,模型可能继续详述一个自洽却错误的前缀。通过细粒度轨迹分析,我们识别出思考陷阱(Thinking Traps),即后续反思、替代尝试或验证均无法修正根本错误的前缀主导型死锁。在 DAPO-MATH 的一个精选子集上,89% 的失败表现出此类陷阱。为解决该问题,我们提出 TAAR(Trap-Aware Adaptive Restart),一个测试时控制框架,训练诊断策略从部分轨迹预测两个信号:指示截断位置的陷阱索引,以及指示是否以及以多大强度干预的逃脱概率。在推理时,TAAR 在预测的陷阱段之前截断轨迹并自适应重启解码;对严重受困情形,它施加更强的扰动,包括更高温度重采样与可选的结构化重启后缀。在具有挑战性的数学与科学推理基准(AIME24、AIME25、GPQA-Diamond、HMMT25、BRUMO25)上的实验表明,TAAR 无需微调基座模型参数即可提升推理性能。

长思维链中的思考陷阱:可度量研究与陷阱感知自适应重启
图2:TAAR 框架总览。左:诊断数据构建流程,通过 GLM-4.7 标注并经人工核验,对轨迹分段并标注陷阱索引(trap indices)与逃脱概率。中:诊断策略 π ϕ \pi_{\phi} 的训练。右:自适应重启控制器基于 p ^ \hat{p} 选择干预。