论文
编程智能体的过程评估究竟测量什么:动作、任务与步骤是三个不同层级
What Process Evaluation of Coding Agents Actually Measures: Action, Task, and Step Are Three Different Levels
摘要
对编程智能体的评估越来越不只看它是否解决任务,还看它如何执行任务。然而,现有的过程级评估常把动作预测、任务不确定性与步骤归因当作同一个问题,使得这类评估究竟测量什么变得不清楚。本文引入一个编程智能体过程评估的测量框架,并用SCAE实例化步骤级因果归因——一个从智能体执行的结构因果模型导出的、基于回放的估计器。该框架结合前缀条件下的识别、基于回放/干预的估计,以及受控的裁判信息操纵,在动作、任务与步骤三个层级上研究过程评估。在来自12个仓库的499个文件定位片段上的实验表明:下一动作主要由执行来源而非代码图转移驱动;执行不确定性在任务层级而非步骤层级上呈结构化;全轨迹裁判表现出系统性的对撞偏差。这表明当前的过程评估往往测量的是语义相关性,而非经过认证的因果贡献。