论文

DiagEval:使用 GUI智能体 进行可靠软件评估的轨迹条件诊断

DiagEval: Trajectory-Conditioned Diagnosis for Reliable Software Evaluation with GUI Agents

模型评测评测方法与指标

摘要

评估 LLM 生成的交互式软件除了静态分析之外还需要执行。关键的困难在于正确性是潜在 UI 状态转换图上的图级可达属性,而 GUI 评估器仅观察单个执行轨迹。因此,失败的采样轨迹仅排除了一条已实现的路径,从而使评估者端执行错误和真正的软件缺陷之间的故障归因变得模糊。我们推出 DiagEval,这是一种用于交互式软件故障后 GUI智能体 评估的轨迹条件诊断评估协议。 DiagEval 不会盲目地从头开始重试,而是重复使用失败的轨迹来选择目标诊断探针,并将其结果聚合为内部归因信号。潜在图视图激发了诊断问题; DiagEval 不会重建图形或估计校准后验概率。我们在 WebDevJudge-Unit 和 RealDevBench 上跨多个 GUI智能体 评估器和 LLM 主干评估 DiagEval。在假阴性情况下,DiagEval 恢复了 45.6-62.1% 的最初被错误归因于软件缺陷的故障,优于基于重试的基线,相对增益为 34.4-160.6%。在完整的评估集上,这种恢复将 WebDevJudge-Unit 上的准确率从 69.9% 提高到 78.3%,将 RealDevBench 上的准确率从 65.0% 提高到 81.6%。这些结果表明,可靠的 GUI智能体 评估不仅需要更强的执行力,还需要主动的故障诊断,以区分评估者方错误与真正的软件缺陷。我们的代码可在 https://github.com/scutGit/DiagEval 获取。