论文
沉默的重量:潜在国际象棋推理中草稿本重量的因果案例
The Weight of Silence: A Causal Case for Weights Over the Scratchpad in Latent Chess Reasoning
摘要
潜在或无声推理让语言模型在连续向量空间而不是单词中执行中间计算,并且被广泛认为充当模型在推理过程中参考的内部暂存器。这一假设是否在强化学习中仍然存在尚未得到直接测试:现有的潜在推理因果分析仅限于数学和逻辑任务,比较一个检查点内对思想的依赖,而不是在强化学习之前和之后进行比较。我们通过分阶段的潜在推理课程和强化学习来训练下棋模型,发现合法性单调攀升至 61%(从强化学习前的 48% 基线),同时将死虚构被完全消除。为了找到这种增益,我们在强化学习之前和之后在同一模型上运行六条件因果干预套件:替换或干扰思想向量会使性能保持不变,消除它们只会导致轻微的退化,并且只有精确的零向量才会导致崩溃。这种稳健性差距本身就是一个发现:在精确零腐败的情况下,强化学习前的合法性下降至 1%,而强化学习后的合法性则下降至 9%,这一差距在全套测试的校正后仍然存在。强化学习后检查点自身测试组的 10 倍大复制证实了这一点:无论是否恢复序列长度,删除思想也具有重要意义;替代和噪音与基线仍然无法区分。强化学习似乎增加了对破坏的鲁棒性,而不是对思想内容的依赖。这些结果反驳了该领域的默认假设,即潜在思维充当主动查阅的推理时间便笺簿,并且表明潜在推理的主要作用是在训练期间塑造模型的参数。我们还展示了国际象棋中 RL 的有效增益,其中多个小组报告相同的潜在推理加 RL 配方未能提高 SFT 的准确性。