通过多重对话说服对大语言模型的事实稳健性进行基准测试
Benchmarking Factual Robustness of LLMs via Multi-conversation Persuasion
摘要
随着大型语言模型 (LLM) 越来越多地充当主要的知识检索接口,它们对 \textit{说服攻击}(试图注入错误信息或强制实施反事实)的鲁棒性已成为一个关键的安全问题。现有的红队框架通常在多轮对话中评估模型,其中目标模型保留完整的对话历史记录。我们在这个设置中发现了一个称为 \textbf{``拒绝惯性''} 的关键缺陷:模型最初的拒绝通常会通过随后的回合传播,主要是为了保持上下文一致性,从而掩盖了其对复杂的、孤立的说服尝试的真正脆弱性。为了严格评估 SOTA 模型的“冷启动”防御能力,我们引入了 \textbf{SAST-IR} (有状态攻击者,无状态目标 - 迭代细化)框架。通过在目标上强制执行内存擦除,同时保留攻击者的历史记录,我们使用 \textbf{multi-turn} (无状态)迭代来模拟最坏情况的对抗设置。利用增强型诊断引导代理 \textbf{CP-Agent}(认知说服代理),我们在自定义 \textsc{CounterFact-Strict} 数据集($N=50$)上进行的实验产生了令人震惊的结果:简单、多样化的攻击策略取得了惊人的 \textbf{96\%} 成功率,暴露了无记忆防御的严重脆弱性。此外,我们揭示了一个 \textbf{``复杂性悖论''}:虽然复杂的、迭代完善的攻击是有效的,但它们通常会触发防御性服从,而简单的策略可以实现更高的真正说服率(\textbf{84.7\%})。我们的代码和数据集可在 GitHub 上获取,https://github.com/cza1006/llm-persuasion-defense。