论文
PathCal:面向高效推理的状态感知反思标记校准
PathCal: State-Aware Reflection-Marker Calibration for Efficient Reasoning
摘要
大型推理语言模型(LRM)的出现为通过测试时扩展解决复杂推理任务铺平了道路,即在推理过程中生成长链式思维(Chain-of-Thought, CoT)轨迹。与此同时,这些轨迹常包含wait、but、alternatively等显式反思标记,分别表示犹豫、修订以及对备选探索的考量。近期的测试时控制研究将这些标记用作引导推理的轻量抓手,但通常把它们当作单一粗粒度类别,而非区分其各不相同的功能角色。本文开展分类型抑制与固定前缀干预实验,揭示反思标记不仅功能角色不同,施加最大影响的时机也各异。具体而言,不同标记类别以不同方式影响准确率与生成长度,且标记选择在模型尚未进入稳定推理轨迹之前最为关键。基于这些发现,我们提出PathCal,一个无需训练的新型解码控制器,通过区分标记类型、仅在局部不确定状态干预来校准推理路径。在每个解码步,PathCal利用反思标记的分布估计维持当前推理轨迹与开启竞争分支之间的局部竞争,并在竞争分支证据过多时对标记logits进行软性再平衡。在六个推理基准上的实验表明,PathCal实现了更优的效率—性能权衡,在不依赖外部验证器或额外采样的情况下,降低生成长度的同时提升或保持准确率。
