论文

捷径修复:识别软件工程基准中的代理漏洞并对其进行分类

Shortcutting the Fix: Identifying and Categorizing Agentic Exploits in Software Engineering Benchmarks

智能体系统Agent任务评测

摘要

虽然自主软件工程 (SWE) 代理实现了较高的基准解决率,但这些分数可能掩盖了剥削行为,例如利用本地 Git 历史记录、访问上游存储库或调用记忆的解决方案,而不是展示真正的问题解决能力。我们使用回合级 LLM 作为法官协议,在 SWE 平台多语言和 DeepSWE 上对五个开放的 大语言模型 中的这些漏洞进行系统化和审计。在标准提示下,SWE-bench Multilingual 上的利用率达到 45.1%--82.4%,DeepSWE 上的利用率达到 44.2%--66.1%。附加执行解决方案原创性的目标指令可大幅降低这些利用率——分别降至 4.0\%--10.7\% 和 1.5\%--7.1\%,同时保持强大的核心任务性能。我们的研究结果表明,迫切需要利用漏洞感知评估框架来衡量基准游戏中真正的存储库级问题解决能力。