论文
ProcCtrlBench:评估 LLM 编码智能体 中的过程级缺陷和控制保留
ProcCtrlBench: Evaluating Process-Level Defects and Control Preservation in LLM Coding Agents
摘要
LLM 编码智能体 的现有基准主要评估最终结果。虽然这些指标对于衡量整体能力很有用,但其可见性有限,并且经常会错过执行过程中出现的缺陷。我们提出了 ProcCtrlBench,这是 LLM 编码智能体 中执行过程评估的基准。 ProcCtrlBench 将经常出现的执行缺陷组织成可重用的本体,涵盖 4 类 11 种缺陷类型,并通过标准化流程证据而不是仅通过最终结果来评估代理轨迹。为了支持异构代理之间的比较,ProcCtrlBench 将原始日志标准化为统一的轨迹表示形式,并根据流程级别的结果报告校准的记分卡。此外,ProcCtrlBench 使用控制保留作为量化执行过程质量的一种方式,捕获执行是否仍然可解释、可中断、可纠正、可逆,以及是否能够在需要时交还权限。我们使用从三个基准测试中抽取的 200 个案例来评估 ProcCtrlBench:AndroidBench、TerminalBench 和 SWE-bench-Verified。结果表明,ProcCtrlBench 可以以有用的可靠性进行实例化,提供比直接阈值更稳定的语义,并揭示执行质量方面的有意义的差异,而这些差异往往被传统的基于结果的评估所忽视。