论文
AppEval:跨移动平台的应用修复与原生工具链评测
AppEval: A Unified Benchmark for LLM-Based Mobile Application Repair in ArkTS, Swift, and Kotlin
摘要
存储库级 LLM 代理通常在其测试在构建主机上运行的项目上进行评估。目前尚不清楚他们的修复是否能够在移动构建-安装-启动-测试边界中幸存下来,在该边界中,缺少 SDK、离线设备或预断言崩溃可能会被误认为是程序故障。我们推出了 AppEval,这是一个基准和本机工具链评估框架,用于跨 HarmonyOS/ArkTS、iOS/Swift 和 Android/Kotlin 的移动应用程序修复。每个任务将隐藏行为测试与参考生产修复分开,并且仅当相同的已安装应用程序目标在有缺陷的修订上达到断言失败并在修复后通过时才被接受;基础设施故障仍然是一个明显的结果。通用模式将此契约映射到每个平台的构建系统、运行时和测试运行器。审核后的 Android 分区包含来自 24 个独立可构建存储库的 200 个已接受的检测任务。在这些任务中,五个代理在 22.00% 到 90.50% 之间实现了 Pass@1,在相同的动态预言下,相差 68.50 个百分点。这些结果表明,移动修复性能在很大程度上取决于评估的代理,同时证明了为什么运行时感知的接受对于有意义的比较是必要的。本文的定量研究结果是针对 Android 的;在得出跨平台概括性结论之前,需要经过审核的 iOS 和 HarmonyOS 结果。