论文

Asuka-Bench:未指定用户意图和多轮细化的基准代码代理

Asuka-Bench: Benchmarking Code Agents on Underspecified User Intent and Multi-Round Refinement

智能体系统Agent任务评测

摘要

现有的代码生成基准测试对从完整提示到一次性输出的单个映射进行评分。然而,真正的网络开发是不同的。用户很少在一开始就编写完整的规范;许多需求只有在查看中间结果并对其做出反应后才会变得清晰。我们推出了 Asuka-Bench,这是一个基准测试,它将未指定的用户意图与基于浏览器渲染行为的多轮细化相结合。每个任务都通过闭环解决:代码代理生成 Web 项目,UI 代理在部署的站点上执行测试用例,用户 LLM 将评估结果转换为下一轮的自然语言反馈。该基准包括 50 个 Web 任务、784 个评估标准和 2402 个预期结果。我们对 2 个代理框架中的 8 个 LLM 进行了基准测试。结果清楚地区分了模型:加权任务通过率相差 38 个百分点,并且模型根据反馈进行修复的能力也存在很大差异。 Asuka-Bench 也远未饱和:即使是最强的模型在三轮后也只能完成 52% 的项目。