论文

MobilePA-Bench:在复杂真实世界任务上评测移动规划智能体

MobilePA-Bench: Benchmarking Mobile Planner Agents on Complex Real-World Tasks

智能体系统Agent任务评测长程任务评测

摘要

随着端侧LLM智能体演化为个人副驾,移动操作系统已成为这一范式的关键试验场,使严格的能力评估变得必不可少。然而现有基准分为两派,各有致命盲区:以GUI为中心的基准测试表层的屏幕操作,却忽视后台工具使用与长视界规划;而静态函数调用基准依赖离线API匹配,脱离真实运行时约束。为弥补这一缺口,我们提出MobilePA-Bench,一个交互式、有状态、以工具为中心的基准,用于评测移动规划智能体的工具调用与规划能力。MobilePA-Bench运行在可执行沙箱上,该沙箱维护实时应用数据库并返回结构化反馈,覆盖13个功能域和212个真实移动工具。除基本工具使用外,它还沿三个高级维度评测中央规划智能体:(1)子智能体协作——分解复杂任务并把专业化工作委派给有能力的子智能体;(2)记忆使用——回忆存储的记忆、用户画像和过往偏好以解析隐式请求;(3)技能使用——调用预打包的组合技能而非从头规划每一步。大量实验表明,当前前沿LLM在移动场景下仍不可靠:在严格工具顺序、权限限制和意外运行时错误下,性能急剧下降。通过将交互式函数调用沙箱与基于证据的验证相结合,MobilePA-Bench既是实用的诊断基准,也是Agentic强化学习的交互式基础——加速可靠移动智能体的开发。

MobilePA-Bench:在复杂真实世界任务上评测移动规划智能体:论文配图
图2:MobilePA-Bench 评估范式概览。该框架将移动智能形式化为以工具为中心的编排循环。其核心是中央规划智能体,负责高层决策,直接调用结构化业务工具,并将专门步骤路由到模块化子智能体,包括 GUI 与视觉处理子智能体。它还可以检索用户记忆(Memory)并加载可复用技能(Skills)。由领域数据库支撑的有状态移动环境(Mobile Env)执行每个动作,并返回关于状态变化或系统错误的可观察反馈(Feedback),使规划器得以更新其下一步决策。