论文
反思引导:将反思与激活空间中的推理分开,以实现词元高效的推理
Reflection Steering: Disentangling Reflection from Reasoning in Activation Space for Token-Efficient Inference
摘要
大型推理模型通常会产生带有验证、修正和回溯的推理痕迹。当反思仅仅重新检查已建立的结果时,它会浪费推理词元并增加延迟。大多数现有的反思引导方法在预设层上添加了标签导出的均差方向,但它与推理和长度信号的纠缠破坏了准确性与效率的权衡。在本文中,我们提出了反思引导,这是一个 无需训练 框架,用于通过将反思相关激活与一般推理分开来控制 LLM 内的反思相关计算。具体来说,我们对比每个 LLM 层的反思和非反思隐藏状态,使用 PCA 对所得反思方向进行去噪,并将它们与一般推理方向正交化。为了限制早期层干预的下游放大,我们在一个小集合上跨多个干预强度校准每个层,仅保留稳定层,并对它们的残余流激活应用有界投影去除。我们针对最先进的激活引导基线,在两个公共基准和三个开放权重 LLM 上进行了广泛的实验。结果表明,反思引导在六种匹配设置中平均减少了 16.9% 的推理标记。此外,我们的方法还引入了有界反思干预强度参数$α$,使得部署时间调整能够平衡词元节省、准确性和生成稳定性。