论文

AgentGuard:从异常编码代理轨迹中学习执行护栏

AgentGuard: Learning Execution Guardrails from Anomalous Coding-Agent Trajectories

智能体系统Agent 动作执行与治理

摘要

人工智能编码代理越来越依赖执行工具来与存储库和外部工具进行交互。然而,任务的成功并不能保证可靠的执行。代理仍然可以修改不相关的文件、重写测试、发出不安全的命令或忽略失败的验证,从而激发行为护栏以实现可靠的执行。我们提出了 AgentGuard,一个指令级护栏框架,可以从编码代理的异常轨迹中学习条件执行约束。 AgentGuard 不依赖于手动指定的安全规则,而是自动提取重复执行失败模式,将它们概括为指令级行为约束,并将它们组织为轻量级防护技能,仅动态激活与当前指令相关的规则。这种设计可以实现行为指导,同时最大限度地减少对正常执行的不必要限制。我们使用从 382 个存储库任务的实际编码代理执行中收集的 642 个记录的故障跟踪来评估 AgentGuard。护栏是从涵盖 282 项任务的 461 条跟踪中学习的,并在一组不相交的 100 项任务上进行评估。使用 Claude Code 和 Claude Haiku 4.5 作为底层编码代理,我们将基线代理与由 AgentGuard 增强的相同代理进行比较。实验结果表明,AgentGuard将异常执行率从69.0%降低到26.7%,将任务成功完成率从21.7%提高到35.0%。这些结果表明,从历史故障中学习的执行护栏可以显着提高人工智能编码代理的可靠性,同时凸显平衡安全性和任务完成的剩余挑战。