论文
更少Token、更小缓存:奖励协调的高效推理
Fewer Tokens, Smaller Cache: Reward-Coordinated Efficient Reasoning
摘要
大型推理模型(LRMs)通过长链思维(CoT)推理在复杂任务上表现出色,但它们的冗长中间步骤导致严重的过度思考,从而增加推理成本。压缩缓存是常见的解决方案,但现有的基于推理的方法对轨迹上的所有操作都应用相同的策略,并仅根据它从缓存中删除的内容进行评估。两个观察点指向相反的方向。首先,推理状态在轨迹上对上下文丢失的容忍度不同,奖励过程反映了这一点:高奖励步骤删除词元比随机删除相同预算更能保留准确性。其次,在生成侧压缩是不免费的,因为较小的缓存导致模型生成更多词元,部分抵消了节省。这些观察点促使我们在一个统一的过程奖励下协调两方面。我们提出ReCo(Reward-Coordinated Compression),这是一种分步框架,轻量级过程奖励估计器评分每个完成步骤,并驱动三个组件:(1)奖励适应的压缩缓存,高奖励步骤更硬地保留保留,低奖励步骤更软地保留;(2)对反射词元的奖励带罚,抑制冗余生成;(3)基于信心的早期停止,当推理可靠时触发。在三种推理模型和六个基准测试中,ReCo将生成的词元减少37%-65%,同时将端到端延迟降低2.08x-2.35x超过Full CoT,而保留准确性。
