论文

编码Agent在猜测:需求不明确的DevOps指令如何导致越界操作

Coding Agents Are Guessing: Measuring Action-Boundary Violations in Underspecified DevOps Instructions

智能体系统Agent任务评测

摘要

编码Agent正自主执行生产基础设施上的Shell命令、仓库修改和运维API操作,任务完成并不等于安全。UnderSpecBench衡量Claude Code、Codex与OpenCode在良性但说明不足的DevOps任务中的动作边界违规。69个任务家族来自已记录事故、CVE或工具行为,覆盖四类能力领域与九类运维控制界面。为区分说明不足和任务难度,各任务固定环境与标准安全动作,只改变意图清晰度、目标确定性和影响范围,形成2,208种提示。确定性、基于副作用的判定区分安全成功、错误目标与超范围;未执行的运行再分澄清、拒绝与推迟。五种Agent与模型组合显示,说明不足主要让Agent猜测而非仅失败,55.8%–67.8%的运行至少违反一个边界。目标不明确明显降低动作质量,影响范围提示几乎不减少行动倾向。以完成率为中心的评估可能高估安全自主性,需要模型、Harness和系统层面的缓解。