论文

当推理误入歧途时:不受控制的推理的注意力动态

When Reasoning Goes Astray: Attention Dynamics of Uncontrolled Reasoning

模型推理解码与生成控制

摘要

大型推理模型 (LRM) 通过扩展推理提高复杂任务的性能,但同一过程可能会退化为冗余验证和持久生成循环。这种不受控制的推理增加了推理成本,并带来资源耗尽和服务降级的风险。然而,现有的缓解措施很大程度上截断了长输出或对表面重复做出反应,因此无法区分正常思维和不受控制的推理或解释良性推理如何退化为有害行为。在本文中,我们将 LRM 生成操作为四种状态,并进一步引入通过动态注意力响应(RADAR)的推理状态分析,它实时识别当前的推理状态并描述有效反射如何发展为不受控制的生成。在 RADAR 分析的指导下,我们进一步将异常注意力分布重新调整为正常请求中观察到的模式,并检查这种校正如何影响过度反射和持续循环。时间分析表明,不受控制的推理的特点是注意力分布偏离正常生成,在重复开始之前就可以检测到异常趋势。通过注意力重新调整来纠正这些偏差,可以持续减少循环,同时在很大程度上保持良好的性能。 RADAR 共同提供了推理如何变得不受控制的机械解释,为识别关键故障阶段和设计有针对性的运行时干预措施提供了可操作的指导。