论文

思考更少,了解更多:具有知识指导的状态感知推理压缩,以实现高效推理

Think Less, Know More: State-Aware Reasoning Compression with Knowledge Guidance for Efficient Reasoning

模型推理推理加速

摘要

大型推理模型 (LRM) 通过利用长思维链 (CoT) 在复杂任务上实现了强大的性能,但往往会受到过度思考的影响,导致推理步骤过多和推理延迟较高。现有的 CoT 压缩方法很难平衡准确性和效率,并且缺乏对冗余和推理偏差的细粒度、步骤级适应。因此,我们提出了带有知识指导的状态感知推理压缩(STACK),这是一个通过显式建模阶段特定冗余源并与检索增强指导集成来执行逐步 CoT 压缩的框架。 STACK构建在线长短对比样本,并在不确定或有偏差推理状态的知识引导压缩和过长但自信状态的自我提示压缩之间动态切换,并辅以基于答案收敛的早期停止机制来抑制冗余验证。我们进一步通过结合近端策略优化(PPO)和直接偏好优化(DPO)提出奖励差异驱动的训练策略,使模型能够学习状态条件压缩策略。在三个数学推理基准上的实验表明,STACK 实现了卓越的精度-效率平衡,与现有方法相比,平均响应长度减少了 59.9%,同时精度提高了 4.8 个百分点。