论文

纠正少数决策词元即可恢复推理能力

Reasoning Can Be Restored by Correcting a Few Decision Tokens

模型推理解码与生成控制

摘要

大型推理模型(LRM)在富有挑战性的推理基准上大幅超越其基础LLM,但基础模型在逐词元生成过程中究竟在何处出错、以及如何高效缩小这一差距,仍知之甚少。我们通过基于似然的散度量化基础模型与更强推理模型之间的词元级分布分歧,来研究基础-推理差距。跨基准来看,我们发现推理优势高度稀疏,集中在少数早期的、与规划相关的决策词元上。例如在Qwen3-0.6B上,仅约8%的生成词元贡献了显著分歧,这些词元集中在响应早期,在规划相关决策上明显富集(17倍),并与基础模型的高不确定性重合——表明基础模型主要在引导后续推理轨迹的早期规划点上出错。基于这些发现,我们提出分歧引导的词元干预,一种简单的推理时委托方案:仅在高分歧位置由推理模型接管单个词元,随即切回基础模型。以很小的干预预算,这种稀疏委托即可大幅恢复、甚至超越同规模推理模型在挑战性推理任务上的表现。代码发布于 https://github.com/AlphaLab-USTC/RRTokenIntervention。

纠正少数决策词元即可恢复推理能力:论文配图
图 1:分歧引导的token干预及其有效性。通过强大的 LRM(即顶部数字)由高令牌级分布分歧触发的 8% 关键令牌的干预,使 0.6B 基础模型能够恢复 8B 强 LRM(即底部数字)的大部分推理能力,并优于其训练后的 0.6B 变体。