论文

当进一步推理无济于事时停止:推理模型中的注意力状态自适应生成

Stop When Further Reasoning Won't Help: Attention-State Adaptive Generation in Reasoning Models

模型推理测试时计算扩展

摘要

通过结合测试时计算扩展,大型推理模型 (LRM) 可以通过显式的思想链 (CoT) 推理过程解决复杂问题。然而,他们经常会过度思考,导致冗余的词元输出和准确性下降。当前缓解此问题的方法仍然有限:基于训练的方法需要大量计算资源,而 无需训练 方法依赖于精心设计的提示或不可靠的置信信号。在这项工作中,我们从注意力分布的角度研究早期停止,并提出一种简单的方法 ASAG,它推断模型的推理状态并自适应调整生成策略。所提出的框架是 无需训练,即插即用,能够无缝集成到现有的 LRM 中。对九个基准的广泛实验表明,具有不同参数范围的主流 LRM 具有一致的改进,包括 DeepSeek-R1-Distill 和 Qwen3 系列。具体来说,在 Qwen3-8B 上的所有推理任务中,ASAG 将平均准确度提高了 3.2%,同时将生成的标记数量减少了近 40%。