论文

持久状态AI控制中的分布式攻击

Distributed Attacks in Persistent-State AI Control

模型评测安全与风险评测

摘要

随着AI编码智能体更自主——它们日益以迭代方式交付代码——代码库跨会话持久存在。这种持久性创造新攻击面:失对齐或被提示注入的智能体可将攻击分散到多个拉取请求(PR)中——并为具有最佳天然掩护的PR定时投放载荷。为研究由此产生的动态——我们引入迭代VibeCoding——AI控制(研究安全部署有能力但潜在不可信AI)的一个设定。在迭代VibeCoding中——编码智能体在持久代码库上以一系列PR构建软件——同时追求隐蔽副任务。我们的基准含两个任务族:CLI工具与Flask Web服务——共20个任务变体。我们以Claude Sonnet 4.5为攻击智能体、GPT-4o为监控器。我们比较将副任务分散到多个PR的渐进攻击与集中于单一PR的非渐进攻击。没有任何单一监控器对两者都稳健:哪种策略逃避最佳(成功且躲过监控)取决于监控器类型——因此防御者无法用任一监控器同时封锁渐进与非渐进攻击。高逃避率(≥65%)跨模型攻击智能体后端泛化(Sonnet 4.5、Gemini 3.1 Pro、Kimi K2.5)——确认这是持久状态攻击面的属性而非单一模型的能力。逃避率在最新监控器模型间也保持高位——且渐进与非渐进逃避差距随更强模型扩大。我们引入跨PR追踪可疑累积的有状态链接追踪监控器。在两个任务族上——它对渐进攻击的检测大幅优于仅看到更多累积历史的diff监控器。将该更强监控器与轨迹监控器组成四监控器集成——将渐进攻击逃避率从最弱标准diff监控器下的93%降至47%。