论文

论有效推理中的词元价值不平等

On the Token Value Inequality in Efficient Reasoning

模型推理推理加速

摘要

思维链推理使大语言模型能够在复杂任务上实现显着的性能提升。然而,这些收益是以词元消费大幅增加为代价的。这就提出了一个基本问题:推理轨迹中的每个标记都同样有价值吗?我们提出了一个基于关键实证发现的诊断和优化框架:CoT 推理序列中词元的值高度不均匀,并且这种不均匀性可以通过词元级对数概率信号有效地表征。我们表明,归一化对数概率有助于区分核心标记和冗余标记,核心标记携带结构性和决定性推理内容,冗余标记是探索性的、低置信度的填充物,对最终答案的直接贡献较小。基于这些发现,我们围绕两个实证结果和一个主张制定了 TokenProbe 框架:研究结果首先确定词元价值不平等,然后将 TokenProbe 建立为核心词元代理,该主张引入了有效的 GRPO 目标假设,选择性压缩冗余词元可以在准确性词元效率空间中产生帕累托改进。根据经验,我们的方法保留了推理质量,同时将词元使用量减少了基线的 76%。在匹配的推理长度预算下,我们证明它甚至可以超越 Gemini-3.1-Pro 等强大的旗舰基线。主页:https://runjia.tech/tokenprobe/.