论文
面向高效 LLM 推理的状态转移框架
A State-Transition Framework for Efficient LLM Reasoning
摘要
虽然长思维链(CoT)推理显著提升大语言模型(LLM)在复杂推理任务上的表现,但生成长 CoT 序列的大量计算与内存成本限制了其效率与实用性。现有研究通常通过压缩 CoT 序列来提升 LLM 的推理效率,然而这种做法与测试时扩展相冲突,限制了 LLM 的推理能力。本文提出一个把 LLM 推理过程建模为状态转移过程的高效推理框架。具体而言,我们首先应用线性注意力机制估计 LLM 的推理状态,该状态记录此前推理步骤的历史推理信息。然后,基于查询提示与推理状态,LLM 可以高效执行当前推理步骤并更新状态。借助线性注意力,当前推理步骤中的每个 token 都能直接从推理状态中检索相关历史推理信息,而无需显式关注先前推理步骤中的 token。这样,注意力的计算复杂度从二次降为线性,显著提升 LLM 的推理效率。此外,我们提出基于状态的推理策略,以缓解噪声推理步骤导致的过度思考问题。在多个数据集与模型规模上的大量实验表明,我们的框架不仅提升了 LLM 的推理效率,还增强了其推理性能。
