论文
深入歧义:A*启发的多智能体常识混淆攻击
Dive into Ambiguity: A*-Inspired Multi-Agents Commonsense Obfuscation Attack on LLM Prompts
摘要
大型语言模型(LLM)在推理和知识密集型任务中表现出色,但仍然容易受到即时级别的对抗性攻击,这些攻击会在触发常识性幻觉的同时保留意图。这个漏洞非常紧迫,因为大语言模型正在迅速融入安全关键领域,而事实可靠性是不容妥协的。现有的攻击方法要么缺乏效率,要么无法捕获现实世界对手的自适应策略。我们提出了一个受 A* 启发的事实错误归纳框架,该框架用于生成语义对齐但模糊的提示。其核心是一种由动态语义分散系数 $γ$ 引导的分层重写策略,该策略在反向模拟退火计划之后,平衡早期的保守编辑与后期的激进混淆。为了增强可解释性,我们进一步引入代理机制标签,它发现和完善对抗机制,提供可解释的反向优化。理论上,我们证明即时重写遵循收缩递归,随着 $γ$ 的减少而导致语义崩溃。根据经验,在不同的大语言模型中,我们的方法比穷举探索获得了更高的攻击成功率,同时需要更少的尝试,证明了效率和有效性。
