论文
面向移动Agent评估的LLM裁判基准测试
Benchmarking LLM Judges for Mobile Agent Evaluation
摘要
移动Agent基准日益依赖基于LLM的裁判来评估任务完成情况,但这些裁判在移动Agent轨迹上的可靠性基本未被检验。我们提出MobileJudgeBench,一个系统性评估LLM-as-judge方法在移动Agent轨迹上表现的基准。该基准包含931条人工标注轨迹,横跨6个移动Agent基准、4个Agent模型和68个应用。我们在多个LLM后端上评估6种裁判方法(五种改编自SPA-Bench、A3的两种模式、AndroidArena和AgentRewardBench,外加我们设计的一个简单基线)。实验揭示三个关键发现。第一,带抽样截图的简单基线裁判与专门构建的方法相当、且常常更优,表明更精巧的裁判管线并不总能提升裁判质量;在具竞争力的方法中,LLM后端是主要决定因素。第二,基准质量指标能可靠预测真实世界的裁判效用:它们既与评估中的Agent排名保真度相关,也与裁判作为在线策略强化学习奖励信号时的下游性能相关。第三,跨两个LLM后端的失败分析发现了定性相反的失败剖面——一个保守、一个宽松,与后端的精确率-召回率特性相关。
