论文

信任,但不验证:LLM 源评估中的认知盲点

Trust, but Don't Verify: Epistemic Blind Spots in LLM Source Evaluation

模型评测模型行为与机制分析

摘要

语言模型越来越多地充当认知代理,综合来自多个来源的证据来为决策提供信息。他们是否评估证据的质量,或者仅仅根据表面呈现来汇总证据,仍然知之甚少。我们表明,模型具有单独检测捏造统计数据的能力,但在多源综合过程中不会利用这种能力,从而无论统计数据是捏造的还是有效的,都会产生类似的数值估计。具体来说,源影响由方法注册门控制,该门响应分析文本的分布注册,但不响应数字有效性:例如,统计上不可能的置信区间与有效置信区间具有相同的权重。这种行为分离在来自四个家族(Anthropic Claude、Qwen、OLMo 和 OpenAI GPT-5.4)和三个专业领域的六个模型中复制。机制分析,包括因果追踪、线性探测和组件级归因,都集中在同一个帐户上:模型编码并因果地使用跨域传输的方法注册表示,而可单独解码的数字有效性信号在多源合成过程中被抑制为机会。基于提示的缓解措施,即使是命名精确统计检查的预言机检查表,也会产生全面怀疑而不是选择性辨别,并且我们检查的 后训练 管道强化了捷径,而无需构建数字验证。与跟踪用户偏好的阿谀奉承不同,这种失败跟踪的是来源在分析上是否可信,而不是其声明是否一致。我们将其称为\textit{认知一致性}:就像偏好和安全一致性一样,问题不是能力而是部署。