论文

Transformer难以使用其涌现的世界模型:重探汉诺塔与“思考的幻觉”

Transformers Struggle to Use Their Emergent World Models: Revisiting the Tower of Hanoi, and the Illusion of Thinking

模型评测模型行为与机制分析

摘要

汉诺塔是一个简单的规划谜题,先前工作已证明它对大型推理模型(LRM)具有挑战性。当前模型能解开该谜题的标准形式,但在flat-to-flat变体(初始与目标状态不限于所有圆环都在同一根柱上)上仍然挣扎。本文深入研究了小型自研Transformer与大型第三方LRM如何求解该任务。为了从机制上理解失败,我们首先在预计算的解题轨迹上从头训练小型Transformer。利用多种可解释性技术,我们展示这些Transformer发展出了一个涌现的世界模型:对谜题状态空间(Sierpinski三角形)的线性可解码、几何忠实的表征,且因果地参与解题。其次,我们回到大型LLM,将技术应用于两个前沿推理模型Qwen3.6-27B与DeepSeek-R1-Distill-Qwen-32B,它们尝试通过延长的思维链求解该任务。令人惊讶的是,我们发现两个模型在提示词末尾都近乎完美地编码了Sierpinski世界模型,却在圆环超过3个时在多数任务上失败。我们把这一失败的根源定位于世界模型表征的衰减。我们在规划的不同阶段探测该表征,并通过展示在推理时注入提示词时刻的表征可以提升性能来确立因果关系。因此,模型的失败在于无法维持所需表征,而非表征缺失,且性能至少可以部分恢复。这些结果重新诠释了先前工作报告的性能崩溃:当前的大型推理模型构建了世界模型,随后又将其丢失。

Transformer难以使用其涌现的世界模型:重探汉诺塔与“思考的幻觉”:论文配图
图3:距离匹配探针在第5层SEP token原始残差流上的二维输出,覆盖训练过程(从左到右:第5、25、50个epoch),以及在一个MOVE token处(最右)。每个点对应81种四盘配置之一,按最大盘的位置着色;灰色边连接图上相邻的配置。在SEP token处,三个最大盘子三角形分离为Sierpiński几何形态,跨簇间隙宽于簇内边。