论文

过时文档投毒:检索如何覆盖模型原本正确的答案

Stale-Document Poisoning: When Outdated Retrieval Overrides Correct Model Answers

模型评测上下文与知识检索增强安全与风险评测

摘要

检索增强生成(RAG)可以补充外部知识,但检索到的证据也可能已经失效。研究构建了317项经核实的知识变化,覆盖医学、法律、软件和平台政策,并为每项保留带日期的官方来源。十二个模型的实验显示,旧文档可能推翻模型在没有检索时给出的正确答案;明确要求遵循旧文档会进一步放大这一影响。 研究在50项知识变化中保持历史证据不变,仅改变评测日期,以检查模型是否理解证据的适用时间。单独提供日期只带来有限改善,而明确说明旧证据何时失效,可使较大模型更准确地采用当前答案。因果干预支持有效期信息对最终决策的作用。 时间感知的混合重排序在日期准确时降低了4.6—10.0个百分点的误导率,效果依赖可靠的时间元数据。可靠RAG不仅需要理解检索证据的内容,也需要判断它现在是否仍然适用。

过时检索证据可压过模型原有的正确知识,影响后层的及时答案裕度。
图1(图注摘要):过时检索证据可压过模型原有的正确知识,影响后层的及时答案裕度。