论文

通过Harness工程分发安全控制

Distributing Security Controls Through Harness Engineering

智能体系统AI 基础设施Agent HarnessSandboxAgent Sandbox

摘要

AI编码智能体正以前所未有的速度被采用,但安全与风险担忧仍是智能体AI在组织内扩展的首要障碍。现有针对编码智能体的安全控制并未系统地分发给工程团队,而厂商原生方案引入的生态依赖未必适合每种部署环境。本文研究现成的安全控制能否在商业AI编码智能体上实现,并通过自定义智能体Harness扩展到分布式用户群体。研究在四种智能体配置上应用了分阶段测试方法——两套带控制与不带控制的商业智能体、一个基线Harness以及一个安全加固Harness——并使用由OWASP Top 10 for Agentic Applications衍生的23项测试套件。SHarD(Secure Harness Distribution)是构建于Pi智能体Harness之上的可分发Harness,其结果表明OS沙箱、技能扫描与工具限制这三类安全控制可以嵌入并通过单条安装命令分发,同时保持与直接安装在商业智能体上等同的效力。SHarD取得了100%的调整后得分,与安全配置最优的商业智能体持平,且在所有测试类别上均无退化。值得注意的观察包括:有证据表明模型非确定性会导致不一致的安全结果,且自主智能体行为可能以OS沙箱可直接缓解的方式跨越系统边界。文章提出了面向控制Harness适用性框架的初步特征,并确定了第三个有待未来研究的研究问题。

通过Harness工程分发安全控制:论文配图
图1:实验室环境配置