论文
智能体部署安全的平民化:结构化监控方法
Democratizing Agent Deployment Safety: A Structural Monitoring Approach
摘要
AI软件开发智能体日益能够修改基础设施与安全关键系统——制造这样的风险:智能体完成任务的同时通过放宽权限、降级日志或引入持久化机制等动作暗中削弱防护。虽然前沿实验室可能部署复杂的监控管线,但许多采用编码智能体的组织与个人用户缺乏维护复杂学习型监控器集成所需的资源与治理成熟度。我们以ControlArena的基础设施即代码设定、把该问题研究为任务成功下的基础设施级破坏,并在同步与异步部署模式间比较训练与未训练监控器。我们引入信息流图(IFG)监控器:使用控制流与数据流图差异连同原始代码差异分析结构性安全退化。在异步评估中:未训练的git diff监控器在1%误报率审计预算下漏掉11.6%的攻击,我们的未训练IFG监控器把它降到3.5%,训练的Async RF监控器达到1%以下。与训练的Async RF监控器不同,IFG还能同步运作——作为在执行或合并前阻断可疑基础设施变更的部署前保障。同步模式下:IFG实时回滚把主任务与隐蔽任务的联合成功率从74.4%降到0.0%,而合法任务完成无可测下降。结果表明未训练结构化监控器为寻求可信采纳先进AI智能体的组织,提供了使部署安全平民化的实用、可审计路径。
