论文

思考与不思考:通过稀疏自动编码器解释 大语言模型 的推理机制

Thinking vs. NoThinking: Towards Interpreting Reasoning Mechanisms of Large Language Models via Sparse Autoencoders

模型评测模型行为与机制分析

摘要

虽然采用思维链 (CoT) 的 大语言模型 (LLM) 表现出卓越的推理能力,但区分这种显式思维模式与直接答案生成(NoThinking 模式)的神经机制仍然知之甚少。为了解构这个认知过程,我们将 Top-K 稀疏自动编码器 (SAE) 应用于 DeepSeek-R1-Distill-Qwen-7B 的中间表示,并检查模型在三个不同难度级别的数学求解任务中的不同行为。通过观察,我们发现模型在两种推理模式下的功能存在明显区别:思维模式依赖于稀疏和高强度的特征激活,驱动与问题复杂性无关的言语推论,而无思考模式则表现出优先考虑符号操作的自适应和扩散模式。因果上,通过总激活量抑制三个最活跃的稀疏特征揭示了三个原则:(i)推理和句法结构紧密耦合,因为干预持续降低 \LaTeX{} 和盒装解决方案格式的质量; (ii) 思维通过补偿性过度生成来应对干扰,其特点是元认知线索增加和重复的、低信息的延续; (iii) 连贯的 CoT 行为取决于专业特征之间脆弱的协调,在扰动下产生不同的故障模式,但输出结构始终受损。