论文
因果打结:LLM 可以编码因果方向,但其“是/否”输出无法表达
Causal Tongue-Tie: LLMs Can Encode Causal Direction, But Their Yes/No Outputs Fail to Express
摘要
我们发现 大语言模型 对因果问题的编码与他们的回答不匹配。在反常识 CLadder 项目上,固定线性探针从模型的隐藏状态中恢复有证据支持的答案(准确度约为 0.97),而口头是/否则恢复为常识答案(准确度约为 0.5)。我们将此称为大约 +0.5 间隙因果舌头领带:错误的是/否分解为两种可分离的故障模式:没有内部信号与口头界面无法说出的信号。对于仅输出的因果基准来说,这意味着双向:基准“正确”不一定意味着模型已经理解,而基准“错误”不一定意味着它不能理解。关于 LLM 是否可以根据单个准确度数字进行因果推理的全面主张值得重新审视。