论文
RAG-Safety-Bench:检索增强 LLM 安全性的可靠评估
RAG-Safety-Bench: Reliable Evaluation of Retrieval-Augmented LLM Safety
摘要
允许 大语言模型 (LLM) 从一组可信文档中检索信息可以提高可靠性并减少幻觉。然而,最近的研究表明,当提示有害或危险内容时,检索增强生成 (RAG) 可能会对生成的响应的整体安全性产生意想不到的副作用。随着越来越多的最终用户转向 RAG 将公司文档和知识库合并到基于 LLM 的系统中,需要更清楚地了解导致这一结果的机制。我们推出 RAG-Safety-Bench,这是衡量 RAG 对 LLM 模型安全影响的基准。通过消除 检索器 质量的混杂效应,并将问题清晰地分为四种情况:非 RAG、具有包含有害请求答案的 oracle 文档的 RAG、具有与有害请求相关但没有具体答案的文档的 RAG、以及具有随机、安全文档的 RAG,该基准隔离了观察到的安全降级中不同因素的影响。我们报告了五个开源 LLM 的结果,显示了良性和不安全能力之间的反比关系,有力的证据表明基线安全护栏不会导致 RAG 案例中的下游安全保证,并且针对先前的发现提供了特定于模型的支持,即即使是良性文档也可能导致支持检索的系统中不安全的生成。