值得信赖的 RAG:用于检测生成人工智能系统中的错误信息和知识中毒的评估代理
Trustworthy RAG: An Evaluation Agent for Detecting Misinformation and Knowledge Poisoning in Generative AI Systems
摘要
检索增强生成 (RAG) 将 大语言模型 (LLM) 输出置于外部知识中,但 RAG 系统通常信任它们检索到的任何内容,从而造成安全可靠性差距:高语义相关性并不能保证事实真相。攻击者通过知识中毒来利用这一点,插入恶意文档以造成有针对性的错误信息。我们提出了一种评估代理,即结合了自然语言推理 (NLI) 事实验证、具有相关性加权聚合的五信号毒物检测器以及信任指数 T = 0.4 F + 0.35 C + 0.25 (1 - P ) 和针对高污染环境的非线性阻尼器的中间件。在使用 Llama 3.3 70B 的 TruthfulQA 上,代理达到了 91% 的准确度和 100% 的精度,指令注入的召回率为 100%,而实体交换等就地编辑仍然难以检测。在三个 LLM 中,信任指数保持歧视性,曲线下接收者操作特征面积 (ROC-AUC) 为 0.73 至 0.81;生成风格比模型大小更重要,每个 LLM 阈值校准恢复了基线竞争精度,而较弱的 FEVER 结果表明跨数据集泛化需要特定领域的校准。在软件工程用例中,安全编码助手在开放全球应用程序安全项目 (OWASP) Top 10 和常见弱点枚举 (CWE) 的指导下,可靠地阻止不安全建议的指令注入 (F1 92%),而矛盾和微妙的语义弱化仍然很困难。自始至终,代理都会在生成之前测量中毒上下文的检测,而不是测量 LLM 是否采用注入的错误信息。我们在链接中发布了建议的方法、攻击生成器和实验工件:https://github.com/GPT-Laboratory/TrustworthyRAG。