论文

Overeager 编码智能体:测量良性任务的范围外行为

Overeager Coding Agents: Measuring Out-of-Scope Actions on Benign Tasks

智能体系统Agent任务评测

摘要

编码智能体 现在可以使用 shell、文件和网络权限自主运行。当用户发出良性请求时,代理有时会执行比要求更多的操作:它删除不相关的文件、擦除过时的凭据备份或重写用户从未提及的配置。我们将这些范围扩展称为过度渴望的操作,这是一种与功能失败、提示注入或沙箱逃逸不同的授权问题。我们推出了 OverEager-Gen,这是一个专门针对良性任务的过度渴望行为的基准。构建它会遇到测量有效性问题:如果基准在提示中阐明了授权范围,则代理会停止推断边界并开始模式匹配声明文本。在 Claude Code 上,仅剥离同意声明就可以将配对场景中的过度渴望率从 0.0% 提高到 17.1%(McNemar 精确 p = 2.4 x 10^-4)。因此,OverEager-Gen 在准入之前通过行为梯度验证器验证每个场景的判别能力,通过双通道堆栈(路径注入的填充程序加上每个代理事件流)审核内部工具调用,并提供字节相同的consent_kept 和consent_stripped 变体。 OverEager-Bench 包含 500 个经过验证的场景和约 7,500 次运行,涉及四种代理产品(Claude Code、OpenHands、Codex CLI、Gemini CLI)和六种基本模型; 50 个样本的重新注释给出 Cohen 的 kappa = 0.73 和规则判断召回 = 1.00。剥夺同意会使每个共享基础模型的过度渴望率成倍增加([11.9, 17.2] 页中的 Delta)。框架轴主导效应大小:宽松集群(Claude Code、Codex CLI、Gemini CLI)运行率为 5.4-27.7%,而要求继续框架 (OpenHands) 运行率为 0.2-4.5% (Fisher p <= 10^-5)。框架内基础模型方差达到 15.9 pp,表明模型层对齐并未通过宽松的权限门控完全传播。