论文
推理在步骤流断裂处失败
Reasoning Fails Where Step Flow Breaks
摘要
生成长思维链的大型推理模型(LRM)如今在多步数学、科学与编程任务上表现良好。然而其行为仍不稳定且难以解释,现有分析工具难以应对如此长且结构化的推理轨迹。我们提出Step-Saliency,它将注意力-梯度分数汇聚成沿问题-思考-总结轨迹的步骤间映射图。在多个模型上,Step-Saliency揭示了两种反复出现的信息流失效:浅层锁定(Shallow Lock-in),即浅层过度关注当前步骤而几乎不利用更早的上下文;深层衰减(Deep Decay),即深层逐渐丧失对思考段的显著性,而总结越来越多地关注自身和最近几步。受这些模式启发,我们提出StepFlow,一种受显著性启发的测试时干预方法,它通过Odds-Equal Bridge调整由Step-Saliency测得的浅层显著性模式,并通过Step Momentum Injection在深层添加一个小的步骤级残差。StepFlow无需再训练即可在多个LRM上提升数学、科学与编程任务的准确率,这表明修复信息流可以挽回其部分缺失的推理性能。
