论文

当解码性不够时:语言模型中的逻辑有效性表示、行为分离和因果测试

When Decodability Is Not Enough: Logical Validity Representations, Behavioral Dissociation, and Causal Tests in Language Models

模型评测模型行为与机制分析

摘要

大语言模型 看起来能够进行逻辑推理,但仅正确或错误的答案并不能告诉我们模型内部表示的内容。我们使用匹配的有效-无效前提-声明对来研究五个开放权重 Transformer 模型中的逻辑验证,这些模型在推理族、语义域、模板和难度级别上有所不同。尽管行为表现几乎是偶然的,但逻辑有效性通常几乎可以从隐藏状态中完全解码,并且在保留的模板、域和推理族下仍然具有很强的可解码性。在正确性条件评估被明确定义的情况下,对于行为不正确的示例,有效性仍然是高度可解码的。与此同时,详尽的留一检验揭示了这种概括的明显局限性,并且与随机对照相比,沿着探针衍生的有效性方向进行的干预仅具有微弱的非特异性效果。我们的结果表明,表示有效性、在行为中表达有效性以及因果性地使用有效性是不同的。与有效性相关的信息可以从模型的隐藏状态中强烈解码,而无需在其输出中可靠地表达。