论文
Transformer难以使用其涌现的世界模型:重探汉诺塔与“思考的幻觉”
Transformers Struggle to Use Their Emergent World Models: Revisiting the Tower of Hanoi, and the Illusion of Thinking
摘要
汉诺塔是一个简单的规划谜题,先前工作已证明它对大型推理模型(LRM)具有挑战性。当前模型能解开该谜题的标准形式,但在flat-to-flat变体(初始与目标状态不限于所有圆环都在同一根柱上)上仍然挣扎。本文深入研究了小型自研Transformer与大型第三方LRM如何求解该任务。为了从机制上理解失败,我们首先在预计算的解题轨迹上从头训练小型Transformer。利用多种可解释性技术,我们展示这些Transformer发展出了一个涌现的世界模型:对谜题状态空间(Sierpinski三角形)的线性可解码、几何忠实的表征,且因果地参与解题。其次,我们回到大型LLM,将技术应用于两个前沿推理模型Qwen3.6-27B与DeepSeek-R1-Distill-Qwen-32B,它们尝试通过延长的思维链求解该任务。令人惊讶的是,我们发现两个模型在提示词末尾都近乎完美地编码了Sierpinski世界模型,却在圆环超过3个时在多数任务上失败。我们把这一失败的根源定位于世界模型表征的衰减。我们在规划的不同阶段探测该表征,并通过展示在推理时注入提示词时刻的表征可以提升性能来确立因果关系。因此,模型的失败在于无法维持所需表征,而非表征缺失,且性能至少可以部分恢复。这些结果重新诠释了先前工作报告的性能崩溃:当前的大型推理模型构建了世界模型,随后又将其丢失。
