论文
故我在。我思
Therefore I am. I Think
摘要
我们考虑这样一个问题:当大型语言推理模型做出选择时,它是先思考再决定,还是先决定再思考?本文给出证据表明,可检测的、早期编码的决策塑造了推理模型的思维链。具体而言,我们证明一个简单的线性探针能以极高置信度从生成前激活中解码出工具调用决策,某些情况下甚至在产生任何推理token之前。激活转向(activation steering)为此提供因果支持:扰动决策方向会导致推敲过程被拉长,并在许多样例中翻转行为(依模型与基准不同,比例在7-79%之间)。我们还通过行为分析表明,当转向改变了决策时,思维链过程常常为这一翻转寻找合理化解释,而非抵抗它。综合来看,这些结果暗示推理模型能在开始以文本进行推敲之前就编码动作选择。
