论文

通过语义等效的对抗性攻击引发 LLM 中的内在幻觉

Eliciting Intrinsic Hallucinations in LLMs via Semantically Equivalent Adversarial Attacks

模型评测安全与风险评测

摘要

大语言模型 (LLM) 通常与外部知识源结合使用,通过检索增强生成 (RAG) 等方法提高其事实准确性并减少幻觉。然而,这些系统仍然容易受到内在幻觉的影响,其中模型会生成不忠实或捏造的信息,而这些信息不受检索到的证据支持。我们提出了一种新颖的框架,通过使用通过对抗性优化方法发现的用户查询的自然的、语义等效的变体进行压力测试来评估模型针对这种现象的鲁棒性。我们将我们的框架应用于白盒、灰盒和黑盒对抗设置中的一系列对抗攻击技术,该框架强制执行严格的语义等价约束和内在幻觉目标。通过评估 3 个数据集的 5 个开源和 5 个闭源生成器模型的这些攻击,我们证明,即使是最先进的模型也很容易受到意义保留扰动的影响,这会显着降低上下文 忠实性(GPT-5-mini 的降级高达 50%)。我们的研究结果表明,即使在最先进的 LLM 中,忠实使用上下文证据仍然很脆弱,从而激发了独立于表面查询形式的强大基础的架构和训练目标。代码位于:https://github.com/atriviveksharma/intrinsic_hall