论文

失败作为一个过程:CLI 编码智能体 轨迹剖析

Failure as a Process: An Anatomy of CLI Coding Agent Trajectories

智能体系统Agent任务评测

摘要

大语言模型 (LLM) 编码智能体 越来越多地部署用于在基于终端的环境中自主执行软件工程任务,使其可靠性日益受到关注。现有的实证研究调查了 编码智能体 失败的原因,但它们在很大程度上将失败视为最终结果而不是时间过程,对失败如何出现、演变和变得不可恢复的了解有限。我们首次对 CLI 编码代理故障轨迹进行了大规模实证研究,引入了一个面向过程的框架,通过故障的发生、演变和跨执行轨迹的恢复来分析故障。我们首先在 Terminal-Bench 上收集了跨三个编码代理支架(OpenHands、MiniSWE 和 Terminus2)的 7 个前沿模型生成的 3,843 个执行轨迹,然后仔细过滤它们,以获得 1,794 个完整且有效的手动注释轨迹(超过 63,000 个执行步骤),从中我们得出了涵盖故障发生、根本原因、恢复和跨系统一致性的 14 个发现。我们的研究结果表明,编码代理故障主要是由认知错误引起的,通常在最初的几个执行步骤中开始,并且通常保持隐藏状态,直到不再可能恢复,这表明提高编码代理的可靠性需要更早的验证和干预,而不是仅仅依赖于最终结果评估。