论文
基于步骤级后果推理与聚合的移动智能体自动化轨迹评估
Automated Trajectory Evaluation for Mobile Agents via Step-Level Consequence Reasoning and Aggregation
摘要
对语言引导移动智能体的评估近来已从基于规则转向基于模型的方法,以实现可扩展的自动化评估。然而,现有整体式评估范式一次性处理整条轨迹,导致严重的上下文过载;而且它们主要关注任务完成,忽视操作安全。为解决这些局限,我们提出CRATE,一个新颖的两阶段VLM作为裁判的移动智能体自动化评估框架,兼容开源与闭源模型。借助步骤级后果推理机制,CRATE在每个步骤独立提取与任务相关的视觉线索并推断动作条件下的状态变化;随后通过轨迹级聚合综合所得的步骤级文本证据,给出有证据支撑的任务完成评估。在该评估方案基础上,我们进一步把CRATE扩展为面向操作安全评估的CRATE-S。大量实验验证了CRATE与CRATE-S的有效性与稳健性。由Qwen2.5-VL-72B-Instruct驱动,CRATE在AndroidWorld上取得0.833的F1分数(超出SPA-Bench 20%),CRATE-S在MobileRisk上达到0.697的F1分数,展示出与基准真值的强一致性。代码见 https://anonymous.4open.science/r/CRATE-D580。
