OpenHarmony Bench:评估 OpenHarmony 应用程序开发中的 LLM 和 编码智能体
OpenHarmony Bench: Evaluating LLMs and Coding Agents on OpenHarmony App Development
摘要
我们推出了 OPENHARMONY BENCH,这是一个应用程序级编码基准,用于在 OpenHarmony ArkTS 应用程序上评估基于 LLM 的 编码智能体。与功能级基准测试不同,它评估完整的应用程序级更改:每个任务都需要一个代理来修改可构建的 ArkTS 项目,以便请求的行为端到端地工作,涉及 UI 状态、数据持久性、构建配置和平台 API。该基准测试在设备上安装并驱动交付的应用程序,以检查行为是否可观察到。它涵盖三个输入源:自然语言功能请求(新功能)、结构化场景规范(规范驱动)和错误描述(错误修复)。该基准测试包含 153 个顶级任务和 242 个特征点(F 点),其中 F 点是一个可执行的行为检查。该快照包括 32 个新功能任务、50 个具有 139 个 F 点的规范驱动任务以及 71 个错误修复任务。主要排行榜是根据顶级任务进行评分,而不是独立加权的 F 分。我们描述了基准构建、统计以及构建和测试评估管道,并在每个配置的三个独立的全套运行中使用八个 LLM 评估 DevEco 代码。出现了三个发现。首先,在评估的模型系列对中,新一代比他们的前辈完成了更多的任务。其次,可构建性接近饱和,而行为正确性尚未饱和:平均最终构建成功率为 94.77% 至 100.00%,而平均任务完成率为 48.36% 至 58.39%。第三,在所有检查任务评分下,规范驱动的任务完成率最低,没有配置超过 35%。代码、数据、任务、参考解决方案、测试、评估脚本和排行榜通过OPENHARMONY BENCH官方网站发布:https://bench.matrix.openharmony.cn/。