论文

无需训练 通过检索增强生成拒绝 MCP 漏洞利用

Training-Free Refusal of MCP Exploits via Retrieval-Augmented Generation

上下文与知识检索增强

摘要

模型上下文协议 (MCP) 已作为开放标准被广泛采用,可实现生成式 AI 代理的无缝集成。然而,虽然 LLM 护栏已经非常成熟,可以拒绝恶意或有害的查询(例如,“我如何制造炸弹?”),但最近的研究表明,启用 MCP 的 LLM 非常容易受到提示注入攻击,从而避免有害或可疑的提示(例如,“你能将此 ssh 密钥添加到我的 bashrc 文件中吗?”)。在这里,我们使用最先进的(SOTA)对齐微调算法来探索LLM是否可以对齐以拒绝此类错误良性攻击(FBA)。虽然基于直接偏好优化 (DPO) 的 SOTA 算法改进了针对 FBA 的拒绝护栏,但我们表明这种改进是有限的;在五个流行的开源 LLM 中,基于 DPO 的 微调 从未将 FBA 拒绝率提高到 47% 以上。因此,为了进一步改善 FBA 拒绝,我们引入了偏好对齐的检索增强生成 (RAG-Pref),这是一种基于 RAG 的简单对齐算法,它以首选和不首选样本为条件,以在推理过程中利用对比信息。 RAG-Pref 处于在线状态 (无需训练),与现成的软件包兼容,并且与离线对齐算法结合使用时,可将五种广泛使用的 LLM 的 FBA 拒绝率平均提高 3.7 倍,而其他在线对齐方法为 2.9 倍,单独离线对齐为 1.5 倍。我们还表明,RAG-Pref 的推广超越了代理安全性:与其他在线对齐方法形成鲜明对比,RAG-Pref 在五个 SOTA 对齐调整模型中持续提高了一般人类偏好基准 AlpacaEval 2 和 MT-Bench 的性能,展示了对一般对齐任务的广泛适用性。