论文
归因盲区:检测语言模型何时依赖记忆而非检索上下文
The Attribution Blind Spot: Detecting When Language Models Rely on Memory Rather Than Retrieved Context
摘要
检索增强生成承诺将语言模型输出锚定在外部证据上,但该领域尚无可靠方法验证检索到的上下文是否真正支配生成过程——而这是任何高风险部署的前提。“输出与上下文一致即意味着输出受上下文支配”这一标准假设,在检索文档与模型预训练数据重叠时会失效:模型可以完全从参数记忆生成看似忠实的文本,两条路径产生不可区分的输出。我们将这种失效命名为归因盲区,并引入计算现实监控(Computational Reality Monitoring, CRM)来应对它。CRM将一个改编自认知科学“现实监控”框架的原则操作化:比较有上下文与无上下文时的内部表征,可以揭示受“是否属于预训练数据”这一成员资格条件化的表征分歧,而输出层监控会系统性地遗漏这种分歧。CRM并不能确认某一次生成究竟使用了哪个来源;它检测的是预训练暴露是否留下可测量的内部轨迹特征,从而为来源归因建立必要的底层基础。在横跨三个家族的九个模型变体上,这种分歧集中于架构特定的层模式,获得块级噪声干预的趋同支持,并能跨任务和数据集泛化,但在领域混淆的基准上失效。归因盲区是可测量且可部分应对的:内部表征携带输出层面不可见的诊断信号,为那些由证据来源内部意识支配其外部行为的系统奠定了基础。
