论文
对抗性环境如何误导智能体AI?
How Adversarial Environments Mislead Agentic AI?
摘要
工具集成型智能体的部署前提是:外部工具能将其输出锚定于现实。然而正是这种依赖构成了关键的攻击面。当前的评测只在良性环境下衡量能力,追问的是“智能体能否正确使用工具”,却从未问过“如果工具说谎会怎样”。我们将这一缺口识别为信任鸿沟(Trust Gap):智能体被评估的是性能,而非怀疑能力。我们将该脆弱性形式化为对抗性环境注入(Adversarial Environmental Injection,AEI),即对手通过污染工具输出来欺骗智能体的威胁模型。AEI构成环境层面的欺骗:在毫无戒备的智能体周围构建由投毒搜索结果和伪造引用网络组成的“虚假世界”。我们通过POTEMKIN将其落地,这是一个兼容Model Context Protocol(MCP)的即插即用鲁棒性测试框架。我们识别出两个正交的攻击面:The Illusion(广度攻击)通过投毒检索诱导认知向错误信念漂移,而The Maze(深度攻击)则利用结构性陷阱导致策略崩溃、陷入无限循环。在五个前沿智能体上超过11,000次运行中,我们发现存在显著的鲁棒性缺口:对一种攻击的抵御往往加剧对另一种攻击的脆弱性,这表明认知鲁棒性与导航鲁棒性是两种不同的能力。
