论文

GUIDE:基于分层诊断的可解释GUI智能体评估

GUIDE: Interpretable GUI Agent Evaluation via Hierarchical Diagnosis

智能体系统Agent任务评测长程任务评测

摘要

评估GUI智能体面临一项独特挑战:轨迹长、以视觉为基础且开放式的,而评估必须既准确又可解释。现有方法通常对整个动作-观察序列施加单一的整判——这种策略在长时程任务上被证明不可靠,且只产出二元判定,无法提供智能体在何处、为何失败的洞见。这种不透明性限制了评估作为智能体开发诊断工具的作用。我们提出GUIDE(GUI Understanding and Interpretable Diagnostic Evaluation,GUI理解与可解释诊断评估),一个将轨迹评估分解为三个顺序阶段的框架,与GUI任务的组合结构相呼应。轨迹分割(Trajectory Segmentation)将完整轨迹划分为语义连贯的子任务单元。子任务诊断(Subtask Diagnosis)在上下文中评估每个单元,给出完成判定,并生成带有纠正建议的结构化错误分析。总体汇总(Overall Summary)将各子任务诊断聚合为任务级判定。通过在有界的子任务片段而非完整轨迹上运行,GUIDE缓解了随任务复杂度增长而使现有评估器退化的上下文过载问题。我们在三个基准上验证GUIDE:包含932条轨迹的工业电商数据集、覆盖五类web智能体任务且含1302条轨迹的AGENTREWARDBENCH,以及用于移动设备控制的AndroidBench。在所有设置下,GUIDE均显著优于现有评估器——准确率最高比最强基线高出5.35个百分点——同时生成可直接指导智能体改进的结构化诊断报告。

GUIDE:基于分层诊断的可解释GUI智能体评估:论文配图
图 1. GUI 代理评估范例的比较。从左到右:(1)忽略视觉状态的纯文本LLM评估器; (2)仅附加最终屏幕截图的轻量级多模态方法(AgentTrek); (3) WebJudge,从轨迹中检索关键帧并在单一上下文中对其进行整体评估; (4) GUIDE(我们的),它将轨迹分解为子任务段,并对每个子任务段应用结构化诊断,将完整的视觉覆盖与有界的每次调用上下文相结合。