论文

可解码但不忠实:将自然语言原理与程序化验证器耦合

Decodable but Not Faithful: Coupling Natural-Language Rationales to Programmatic Verifiers

模型评测模型行为与机制分析

摘要

语言模型可以为其预测生成合理的基本原理,但这些解释可能无法忠实地代表模型的内部推理。我们提出了验证器耦合推理,这是一个框架,它将内联声明插入到推理轨迹中,并训练辅助一致性头来从基本原理跨度隐藏状态预测程序化验证器输出。核心发现是可解码性和 忠实性 之间的差距:一致性训练可靠地使验证者信息可从基本原理表示中解码,但可解码性并不能保证忠实的生成。在LeanCheck(形式定理证明)中,仅理性池化和仅证明池化在反事实冲突下实现了完美的方向分离。在 KataGo(围棋引擎)中,评论跨度以 81% 的准确度对 10 路胜率桶进行编码。然而在代码设置中,模型实现了 98.6% 的耦合,而其生成的解释仍然不忠实:具有正确结构声明的流畅散文,但描述了不相关的算法;受控的预训练与从头开始的比较表明,差距不是由容量驱动的。合成激活补丁证实了因果影响(73-89% vs. 31% 基线),FEVER 揭示了纯证据池以原始准确性为代价隔离了真正的证据敏感性,每个声明分析表明,与二进制声明相比,一致性损失不成比例地有利于细粒度声明。这些结果表明,一致性损失是有效的诊断和表征塑造工具,但不是忠实推理的充分条件。