论文
面向大推理模型高效推理的动态思考token选择
Dynamic Thinking-Token Selection for Efficient Reasoning in Large Reasoning Models
摘要
大型推理模型(LRM)通过在得出最终答案前显式生成推理轨迹,擅长解决复杂问题。然而,这些扩展生成带来可观的内存占用和计算开销,成为LRM效率的瓶颈。本工作利用注意力图分析推理轨迹的影响,并揭示一个有趣现象:推理轨迹中只有部分决策关键token将模型引向最终答案,其余token的贡献可忽略不计。基于这一观察,我们提出动态思考token选择(DynTS)。该方法识别决策关键token,并在推理时仅保留其相关的Key-Value(KV)缓存状态,逐出其余冗余条目以优化效率。
