论文

最终检查点还不够:沿着训练轨迹分析潜在推理 忠实性

Final Checkpoints Are Not Enough: Analyzing Latent Reasoning Faithfulness Along Training Trajectories

模型评测模型行为与机制分析

摘要

潜在推理在连续隐藏状态下执行多步推理,有望实现更紧凑、更高效的推理。然而,这些不透明的状态提出了一个 忠实性 的问题:潜在的推理步骤是否驱动最终的答案。之前的工作在选定的检查点研究了这个问题,并报告了一些不忠行为。该端点视图留下了 忠实性 的证据在训练期间如何演变的未检验。我们使用经过验证的反事实编辑和对潜在推理状态的干预来跟踪整个训练中的行为和基于激活的证据。我们发现高任务准确性可以与低反事实响应性共存:随着准确性的提高,响应性可能会下降,并且不同的潜在推理方法遵循不同的轨迹。在 ProsQA 上,输出对常态噪声替换的敏感性随着反事实响应性的下降而下降,尽管结果取决于替换。在单独训练的二元选择和开放式 GSM 设置中,干预敏感性遵循相反的轨迹。这些结果表明,仅评估最终检查点可能会掩盖反事实响应何时发生变化以及潜在状态的贡献。