论文

编码智能体 如何让用户失望:对 20,574 个实际会话中开发人员与代理不一致的大规模分析

How Coding Agents Fail Their Users: A Large-Scale Analysis of Developer-Agent Misalignment in 20,574 Real-World Sessions

模型评测模型行为与机制分析

摘要

AI 编码智能体 越来越多地直接在软件环境中发挥作用,但现有的故障分析依赖于基准轨迹,而忽略了开发人员实际体验失调的情况。我们对 IDE 和 CLI 工作流程中 1,639 个存储库的 20,574 个编码代理会话进行了观察性研究。我们将不一致作为通过开发人员的抵制而可见的故障进行操作,并沿着四个轴注释每个事件:形式、原因、成本和解决方案。我们确定了七种重复出现的形式,涵盖代理如何读取项目、解释开发人员意图、遵循规则、约束其操作、实施和执行代码以及报告进度。 90.50% 的事件会造成工作量和信任成本,而不是不可逆转的系统损坏,但 91.49% 的可见解决方案仍然需要明确的用户纠正。 IDE 和 CLI 设置之间的错位模式也有所不同,在相邻会话中持续存在,并随着时间的推移而变化:虽然总体比率下降,但违反约束和不准确的自我报告的比例却在增加。我们的研究结果为训练、评估和界面的设计提供了信息,以保持 编码智能体 与真实的开发人员工作流程保持一致。