论文

潜在推理模型容易解释吗?

Are Latent Reasoning Models Easily Interpretable?

模型评测模型行为与机制分析

摘要

潜在推理模型(LRM)由于其推理成本低(相对于显式推理模型)和并行探索多个推理路径的理论能力而引起了人们的广泛研究兴趣。然而,这些好处是以降低可解释性为代价的:LRM 很难监控,因为它们不使用自然语言进行推理。本文通过检查两种最先进的 LRM 来研究 LRM 的可解释性。首先,我们发现 LRM 的预测通常不需要潜在推理标记;在逻辑推理数据集上,LRM 几乎总是可以在不使用潜在推理的情况下产生相同的最终答案。推理标记的利用不足可能部分解释了为什么 LRM 不能始终优于显式推理方法,并引起人们对这些标记在先前工作中所声明的作用的怀疑。其次,我们证明,当潜在推理标记对于性能是必需的时,我们可以在高达 65-93% 的时间内解码参考推理轨迹,以正确预测实例。这表明 LRM 通常会实现预期的解决方案,而不是无法解释的推理过程。最后,我们提出了一种在不先验地知道参考推理轨迹的情况下从潜在标记解码经过验证的自然语言推理轨迹的方法,证明可以为大多数正确的预测找到经过验证的轨迹,但只有少数不正确的预测。我们的研究结果强调,当前的 LRM 主要编码可解释的过程,而可解释性本身可以是预测正确性的信号。