论文

面向移动Agent评估的LLM裁判基准测试

Benchmarking LLM Judges for Mobile Agent Evaluation

模型评测模型训练强化学习基准与评测资源Agentic RL

摘要

移动Agent基准日益依赖基于LLM的裁判来评估任务完成情况,但这些裁判在移动Agent轨迹上的可靠性基本未被检验。我们提出MobileJudgeBench,一个系统性评估LLM-as-judge方法在移动Agent轨迹上表现的基准。该基准包含931条人工标注轨迹,横跨6个移动Agent基准、4个Agent模型和68个应用。我们在多个LLM后端上评估6种裁判方法(五种改编自SPA-Bench、A3的两种模式、AndroidArena和AgentRewardBench,外加我们设计的一个简单基线)。实验揭示三个关键发现。第一,带抽样截图的简单基线裁判与专门构建的方法相当、且常常更优,表明更精巧的裁判管线并不总能提升裁判质量;在具竞争力的方法中,LLM后端是主要决定因素。第二,基准质量指标能可靠预测真实世界的裁判效用:它们既与评估中的Agent排名保真度相关,也与裁判作为在线策略强化学习奖励信号时的下游性能相关。第三,跨两个LLM后端的失败分析发现了定性相反的失败剖面——一个保守、一个宽松,与后端的精确率-召回率特性相关。

面向移动Agent评估的LLM裁判基准测试:论文配图
图1:MobileJudgeBench 概览。我们从跨越 6 个基准的 931 条人工标注移动智能体轨迹构建评审基准(左,§3),在 5 个后端上评估 6 种 LLM-as-judge 方法(中,§5.1),并验证基准指标能够预测评审模型在智能体评估(§5.2.1)与在线策略训练(§5.2.2)中的效用,辅以根因失效分析(§5.3)(右)。