论文

MobiFlow:通过轨迹融合实现真实世界移动智能体基准测试

MobiFlow: Real-World Mobile Agent Benchmarking through Trajectory Fusion

智能体系统Agent任务评测

摘要

移动智能体可通过GUI交互自主完成用户指派的任务。然而,AndroidWorld等现有主流评估基准通过连接系统级Android模拟器运行,并基于系统资源状态提供评估信号。但在真实世界的移动智能体场景中,许多第三方应用不暴露系统级API来判断任务是否成功,导致基准与真实使用之间的错配,难以准确评估模型性能。为解决这些问题,我们提出MobiFlow,一个基于取自任意第三方应用的任务构建的评估框架。借助基于多轨迹融合的高效图构建算法,MobiFlow能有效压缩状态空间、支持动态交互,并更好地契合真实第三方应用场景。MobiFlow覆盖20款广泛使用的第三方应用,包含240个多样化真实任务,并配有丰富的评估指标。与AndroidWorld相比,MobiFlow的评估结果与人类评估具有更高一致性,并能指导未来GUI模型在真实工作负载下的训练。

MobiFlow:通过轨迹融合实现真实世界移动智能体基准测试
图 3:不同建模方法中交互元素计数分布的比较。左图展示了基于应用程序的建模方法,右图展示了基于任务的建模方法。