论文

REALISTA:引发 LLM 幻觉的现实潜在对抗性攻击

REALISTA: Realistic Latent Adversarial Attacks that Elicit LLM Hallucinations

模型评测安全与风险评测

摘要

大语言模型 (LLM) 在许多任务中都取得了出色的表现,但仍然容易产生幻觉,因此系统地评估其在现实对抗性输入下的可靠性非常重要。我们将幻觉诱导表述为一个约束优化问题,其目标是找到与良性用户提示等效的语义连贯的对抗性提示。现有的攻击方法仍然有限:基于离散提示的攻击保留了语义等价性和连贯性,但仅搜索有限的一组提示变体,而连续的潜在空间攻击则探索更丰富的空间,但通常解码为不再有效的改写提示。为了解决这些限制,我们提出了 REALISTA,一种现实的潜在空间攻击框架。 REALISTA 构建了一个有效编辑方向的依赖于输入的字典,每个方向对应于语义上等效且连贯的改写,并优化这些方向在潜在空间中的连续组合。该设计结合了连续攻击的优化灵活性和基于离散改写的攻击的语义现实性。实验表明,REALISTA 在开源 LLM 上实现了优于最先进的现实攻击或可比的性能,并且至关重要的是,它成功地在自由形式响应设置下攻击大型推理模型,而之前的现实攻击则失败了。代码可在 https://github.com/Buyun-Liang/REALISTA 获取。