论文

面向大推理模型高效推理的动态思考token选择

Dynamic Thinking-Token Selection for Efficient Reasoning in Large Reasoning Models

模型推理KV Cache

摘要

大型推理模型(LRM)通过在得出最终答案前显式生成推理轨迹,擅长解决复杂问题。然而,这些扩展生成带来可观的内存占用和计算开销,成为LRM效率的瓶颈。本工作利用注意力图分析推理轨迹的影响,并揭示一个有趣现象:推理轨迹中只有部分决策关键token将模型引向最终答案,其余token的贡献可忽略不计。基于这一观察,我们提出动态思考token选择(DynTS)。该方法识别决策关键token,并在推理时仅保留其相关的Key-Value(KV)缓存状态,逐出其余冗余条目以优化效率。

面向大型推理模型高效推理的动态思考token选择
图14:R1-Qwen 在全部解码步数上的实时吞吐量、内存与计算开销追踪。结果呈现出与 R1-Llama 一致的趋势,证实了 DynTS 在不同模型架构上的可扩展性。