论文
MobileDev-Bench:移动应用程序开发中问题解决的基准
MobileDev-Bench: A Benchmark for Issue Resolution in Mobile Application Development
摘要
大语言模型 (LLM) 在自动化软件工程任务上表现出了强大的性能,但现有的基准测试主要集中在库式存储库上,尽管移动应用程序开发具有特定于框架的构建系统、异构工件类型和协调的多文件修复要求,但在很大程度上尚未得到探索。我们推出了 MobileDev-Bench,这是一个基准测试,包含从 19 个生产移动应用程序收集的 407 个实际问题解决任务,涵盖 Android Native (Java/Kotlin)、React Native (TypeScript) 和 Flutter (Dart)。每个任务将经过验证的开发人员报告的问题与可执行测试补丁配对,从而在移动构建环境中对模型生成的修复进行全自动验证。该基准测试显示出比之前的基准测试更高的补丁复杂性:平均修复修改 12.9 个文件和 334.6 行,41% 的实例需要跨多个工件类型(例如源文件、构建配置和资源文件)进行协调更改。对四个前沿 LLM(Claude Sonnet 4.5、Qwen3-Coder、GPT-5.2 和 Gemini 2.5 Flash)的评估,在自动检索下,端到端解析率仅为 3.23% - 4.23%,在预言机检索下最多为 5.69%,远低于现有基准报告的解析率。我们发布了包含任务实例、评估工具和容器化环境的 MobileDev-Bench,以支持人工智能辅助移动应用程序开发的可重复研究。