论文
AgentLAB:对 LLM 智能体进行长视界攻击基准测试
AgentLAB: Benchmarking LLM Agents against Long-Horizon Attacks
摘要
LLM 智能体越来越多地部署在长视界复杂环境中解决难题,但这种扩展使其暴露于长视界攻击——利用多轮用户-智能体-环境交互实现单轮场景中不可行的目标。为度量智能体对此类风险的脆弱性,我们提出 AgentLAB,首个专门评估 LLM 智能体对自适应长视界攻击易感性的基准。目前 AgentLAB 支持意图劫持、工具链化、任务注入、目标漂移和记忆投毒五种新型攻击,覆盖 28 个真实 Agentic 环境和 644 个安全测试用例。利用 AgentLAB,我们评估了代表性 LLM 智能体,发现它们对长视界攻击仍然高度易感;而且为单轮交互设计的防御无法可靠缓解长视界威胁。我们期待 AgentLAB 成为跟踪实际场景中 LLM 智能体安全进展的宝贵基准。基准公开于 https://tanqiujiang.github.io/AgentLAB_main。
