论文

大语言模型 中转向推理的可靠控制点选择

Reliable Control-Point Selection for Steering Reasoning in Large Language Models

模型评测模型行为与机制分析

摘要

引导向量提供了 无需训练 机制来控制 大语言模型 中的推理行为,但构建有效的向量需要识别模型隐藏状态中的真实行为信号。对于可以通过提示切换的行为,这很简单。然而,许多推理行为——比如自我反思——是自发出现的,并且抵制即时水平的控制。当前的方法通过思想链轨迹中的关键字匹配来检测这些行为,隐含地假设每个检测到的边界都编码真实的行为信号。我们证明这种假设是绝对错误的:在 541 个关键字检测到的边界中,93.3% 的边界行为不稳定,无法在从相同前缀重新生成时重现检测到的行为。我们开发了一种概率模型,将内在推理行为形式化为具有上下文相关触发概率的随机事件,并表明不稳定的边界会稀释转向信号。在此分析的指导下,我们提出了稳定性过滤,它仅保留模型一致再现目标行为的边界。结合消除残余问题特定噪声的内容子空间投影,我们的方法在 MATH-500 上实现了 0.784 的准确度(比最强基线+5.0)。生成的转向向量无需重新提取即可在同一架构系列中的模型之间传输,从而改进了 Nemotron-Research-Reasoning-1.5B (+5.0) 和 DeepScaleR-1.5B-Preview (+6.0)。代码可在 https://github.com/zhmzm/stability-steering 获取。