论文

自信与错误:编码智能体 中的无声语义失败

Confident and Wrong: Silent Semantic Failures in Coding Agents

智能体系统Agent任务评测

摘要

随着 编码智能体 进入生产工作流程,团队不仅需要知道代理是否完成任务,还需要知道其操作是否可信。我们表明,完成度和可信度之间存在巨大且系统性的差异。在 50 个 SWE 基准验证任务的 1,750 个轨迹中,我们比较了重复运行的四种前沿模型,并将提交率与测试验证的解决率分开。 GPT-5 提交了 100% 运行的补丁,但仅解决了 44%; Llama 4 提交率为 99%,但解决率为 18%;尽管 Gemini 提交的频率最低,为 70%,但解决的任务比 GPT-5 更多(50% 对 44%)。这些差距不是随机的:它们集中在一种危险的故障模式中,我们称之为无声语义故障。定性地讲,在一个有缺陷的任务上,代理在所有五次运行中提交了一个看似合理的补丁,但没有一个通过,同样的误解重复出现,而不是随机错误。从数量上来说,它主导了失败,覆盖了 Llama 4 失败运行的 80% 和 GPT-5 失败运行的 68%,而且它是不可见的:结果自信且始终是错误的,因此当代理不值得信任时,基于完成度和基于一致性的监控看起来都很健康。轻量级的预编辑提示并不能缩小差距。第二个探测隔离了采取行动的本能:鉴于已经修复的错误,正确的做法是弃权,大多数模型仍然编辑正确的代码。这种行动偏见,在没有必要采取行动时发生,正是完成指标所奖励的。贯穿始终的就是测量:提交率反映了行动,但信任需要有效性。因此,评估必须跟上:通过重复运行中经测试验证的正确性对代理进行评分,报告其不确定性,并奖励那些知道何时不采取行动的人。