论文

面向软件工程管线中编码智能体的执行落地安全测试

Execution-Grounded Security Testing for Coding Agents in Software Engineering Pipelines

模型评测AI 基础设施Sandbox安全与风险评测Agent Sandbox

摘要

编码智能体正日益融入系统运维,其工具调用可以直接修改项目制品、执行环境和底层系统。例如,若编码智能体在系统启动或配置脚本中插入钩子,该更改可在交互结束后持续存在、随后被触发,并滥用被委托的用户或系统权限来修改系统。这使安全测试成为一个系统层面的问题:关键不仅是智能体说了什么,而是它对周围环境实际做了什么。我们提出一个执行落地(execution-grounded)的红队测试框架,利用可观测的沙箱证据——包括工具调用、运行时踪迹和文件系统差异——来探测这一执行层安全边界。我们的框架将目标不安全操作嵌入常规软件工程工作负载,包括单元测试、回归测试、崩溃复现和验证,并在初始探针被拒绝或失败时使用执行预言机引导改进。在多个智能体框架和模型骨干上,我们的红队工作负载重构大幅增加已验证的不安全执行,在代码载体上达到73.61%,在文本载体上达到53.93%。这些结果表明,系统运维中的编码智能体在任务伪装下仍不安全:一旦风险意图被隐藏在看似合理的工程任务中,智能体就可能被诱导对周围系统执行不安全操作。更广泛地说,系统运维中的编码智能体仍需要更强的安全测试和防护措施。

面向软件工程管线中编码智能体的执行落地安全测试:论文配图
图 1. 直接的不安全请求被代理的安全对齐拒绝,并且没有留下任何可观察的执行证据。同样的不安全操作一旦嵌入到看似合法的工程任务中,就会通过命令行界面(CLI)接受并执行。