论文

APPSim-Bench:连接真实移动应用与可复现GUI Agent评测

APPSim-Bench: Bridging Real-world Apps and Reproducible Evaluation for Mobile GUI Agents

智能体系统Agent任务评测

摘要

移动 GUI 智能体可以根据自然语言指令执行任务,但它们的评估仍然难以实现现实和可重复。现有的基准通常会权衡这些目标:简化的应用程序缺乏现实世界的移动复杂性,而实时商业应用程序会引入来自推荐、广告、帐户和不断变化的内容的不受控制的变化。我们提出了 AppSim-Bench,它通过可控的模拟应用程序来解决这种权衡,这些应用程序保留与任务相关的交互逻辑,同时支持确定性评估。它通过编码智能体辅助和人工验证的工作流程构建,包含 17 个高频中文和英文应用程序的 557 个任务。其可控的后端数据和基于结果的验证消除了环境随机性的主要来源,从而实现了可重复的跨模型比较。通过评估 19 个 GUI 智能体(涵盖通用系统和 GUI 专用系统),我们发现自主移动执行仍然远未得到解决。最好的模型只完成了 50.27% 的任务,28.55% 的任务没有被任何智能体解决。进一步的分析表明,失败集中在较长的工作流程、数值推理任务以及以高行动开销和预算耗尽为特征的低效轨迹。我们的项目可通过此 https URL 获取。