论文

更少Token、更小缓存:奖励协调的高效推理

Fewer Tokens, Smaller Cache: Reward-Coordinated Efficient Reasoning

模型推理推理加速

摘要

大型推理模型(LRMs)通过长链思维(CoT)推理在复杂任务上表现出色,但它们的冗长中间步骤导致严重的过度思考,从而增加推理成本。压缩缓存是常见的解决方案,但现有的基于推理的方法对轨迹上的所有操作都应用相同的策略,并仅根据它从缓存中删除的内容进行评估。两个观察点指向相反的方向。首先,推理状态在轨迹上对上下文丢失的容忍度不同,奖励过程反映了这一点:高奖励步骤删除词元比随机删除相同预算更能保留准确性。其次,在生成侧压缩是不免费的,因为较小的缓存导致模型生成更多词元,部分抵消了节省。这些观察点促使我们在一个统一的过程奖励下协调两方面。我们提出ReCo(Reward-Coordinated Compression),这是一种分步框架,轻量级过程奖励估计器评分每个完成步骤,并驱动三个组件:(1)奖励适应的压缩缓存,高奖励步骤更硬地保留保留,低奖励步骤更软地保留;(2)对反射词元的奖励带罚,抑制冗余生成;(3)基于信心的早期停止,当推理可靠时触发。在三种推理模型和六个基准测试中,ReCo将生成的词元减少37%-65%,同时将端到端延迟降低2.08x-2.35x超过Full CoT,而保留准确性。

更少Token、更小缓存:奖励协调的高效推理:论文配图
图 2:ReCo 概述。在每个步骤 cic_{i} 之后,进程奖励 viv_{i} 驱动三个组件: ❶ KV 压缩设置奖励调节保留率,在高奖励步骤中更努力地缩小缓存; ❷ 反射控制将 viv_{i} 映射到反射标记上的奖励带状 Logit 惩罚 βi\beta_{i}; ❸ 一旦答案困惑度满足 PPL⁡(a)≤τp\mathrm{PPL}(a)\leq\tau_{p},提前停止就会停止。