论文

推理减少RAG污染上下文的影响

Reasoning Reduces the Influence of Poisoned Context in RAG

模型评测安全与风险评测

摘要

检索增强生成以外部证据支持大语言模型,也暴露于知识污染攻击:检索文档中的错误信息会影响输出。研究以两个指标检查审慎推理能否减弱影响。Cordon Rate统计已识别错误信息却仍影响最终答案的情况;Leakage Rate统计明确要求忽略污染后,错误上下文仍产生的隐性影响。研究在200道SciFact问题上比较六种配置,包括DeepSeek-V4-Flash与Qwen3.6-Plus的推理开启和关闭。启用推理降低条件性易感程度:DeepSeek的Cordon Rate由0.211降至0.107,Leakage Rate由0.235降至0.140,但整体攻击成功率由0.233升至0.298。结果说明污染识别、攻击成功与抵抗上下文影响是不同能力:审慎推理在识别出污染的条件下减小行为影响,却可能使显式污染识别更不可靠。