论文
在推理模型中预测未来行为可以实现更好的指导
Predicting Future Behaviors in Reasoning Models Enables Better Steering
摘要
部署的大型推理模型 (LRM) 通常会出现意外行为。测试时控制通过干预 LRM 输出的隐藏表示来控制 LRM 输出,但它会降低输出质量。我们认为,先前的指导工作隐含地依赖于检测已生成文本中的行为的内部特征。我们表明,这些检测特征不能很好地预测未来的行为结果,因此不是自然的干预目标。相反,我们训练激活探针来通过中间推理步骤预测未来行为的可能性。这些探针以 64%-91% 的准确度预测最可能的行为,揭示了一种单独类型的内部预测特征。基于这些预测功能,我们引入了一种文本级引导方法,即未来探针控制生成。 FPCG 对多个候选句子进行采样,并根据预测未来行为可能性的探针选择最好的一个。这使得转向几乎不会降低输出质量。 FPCG 还可以在激活引导失败的多个评估中启用引导。这些结果表明,区分检测和预测特征可以采用更细致的方法来控制 LRM 行为。