论文

智慧的形状:语言模型中的决策轨迹

The Shape of Wisdom: Decision Trajectories in Language Models

模型评测模型行为与机制分析

摘要

语言模型并非简单地在输出层选择一个答案。在一项跨越Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct和Mistral-7B-Instruct-v0.3、包含9000条轨迹的MMLU研究中,答案的分数沿深度以结构化的方式移动。我们用三个量来刻画每条轨迹:当前答案的领先幅度(margin)、该幅度在下一层的变化量,以及距离决策翻转的远近。主要的经验图景是正确性与稳定性是两回事:最大的群体是“不稳定但正确”,而非“稳定且正确”。随后在一个被追踪的子集上探究是什么在移动这一幅度。在稳定且正确的情形中,平均注意力标量指向正确方向,而平均MLP标量则不然;片段删除实验表明,删除支持答案的文本会损害该幅度,而删除类似干扰项的文本则有助于它。这一结果并不是一个完整的电路级解释。它提供了一种可复现的方法,用以观察哪些答案已经尘埃落定、哪些依然脆弱,以及哪些被测量的来源在移动它们。