论文

归因盲区:检测语言模型何时依赖记忆而非检索上下文

The Attribution Blind Spot: Detecting When Language Models Rely on Memory Rather Than Retrieved Context

模型评测上下文与知识上下文工程评测方法与指标

摘要

检索增强生成承诺将语言模型输出锚定在外部证据上,但该领域尚无可靠方法验证检索到的上下文是否真正支配生成过程——而这是任何高风险部署的前提。“输出与上下文一致即意味着输出受上下文支配”这一标准假设,在检索文档与模型预训练数据重叠时会失效:模型可以完全从参数记忆生成看似忠实的文本,两条路径产生不可区分的输出。我们将这种失效命名为归因盲区,并引入计算现实监控(Computational Reality Monitoring, CRM)来应对它。CRM将一个改编自认知科学“现实监控”框架的原则操作化:比较有上下文与无上下文时的内部表征,可以揭示受“是否属于预训练数据”这一成员资格条件化的表征分歧,而输出层监控会系统性地遗漏这种分歧。CRM并不能确认某一次生成究竟使用了哪个来源;它检测的是预训练暴露是否留下可测量的内部轨迹特征,从而为来源归因建立必要的底层基础。在横跨三个家族的九个模型变体上,这种分歧集中于架构特定的层模式,获得块级噪声干预的趋同支持,并能跨任务和数据集泛化,但在领域混淆的基准上失效。归因盲区是可测量且可部分应对的:内部表征携带输出层面不可见的诊断信号,为那些由证据来源内部意识支配其外部行为的系统奠定了基础。

归因盲区:检测语言模型何时依赖记忆而非检索上下文:论文配图
图 1:计算现实监控框架。 CRM 比较配对的无上下文和有上下文生成,提取序列、标记和潜在级别的分歧特征,并使用生成的特征向量来检测成员资格条件的表征分歧——这是预训练暴露是否重塑模型内部计算的诊断信号,而不是每代源验证器。