论文

REAP:根据交互式生产使用自动管理 编码智能体 基准

REAP: Automatic Curation of Coding Agent Benchmarks from Interactive Production Usage

模型评测基准与评测资源

摘要

AI 编码智能体 的生产部署需要快速、可重复的评估信号。现有的工业实践在速度和保真度之间进行权衡:在线 A/B 测试需要数周时间,并且存在用户体验风险,影子部署产生的信号在运行中不可重现,公共基准在语言分布、提示样式和代码库结构方面与生产工作负载存在差异。本文介绍了 REAP(相关性和执行审核管道),这是一种自动管理管道,可以从真实的开发人员代理会话构建生产衍生的基准,而无需手动标记。这种管理虽然分配给生产使用,但遇到了一些挑战。无法测试的提示、未对准的测试和测试不稳定都会损害评估的可靠性。虽然可以手动审核任务以确保只有高质量的任务保留在基准测试中,但这种方法在 monorepo 设置中是不可行的:在大型 monorepo 中构建基础设施状态通常是短暂的,并且需要根据当前代码库不断重新制定基准测试。由于无法以这种节奏持续进行手动验证,因此 REAP 使用基于 LLM 的任务分类、代理测试相关性验证和多次运行稳定性检查添加了自动验证层,以确保可执行基准测试产生值得信赖的信号。我们使用 REAP 来策划 Harvest,这是一个基准测试,其中每个任务都会向 编码智能体 提供真正的开发人员提示,并根据从生产中检索到的未能通过的测试来验证生成的代码更改。 Harvest 的发行版涵盖四种以上的编程语言,大部分任务来自 Hack。模型和工具评估显示,五个前沿模型的解决率范围为 42.9% 到 58.2%,揭示了为具体部署决策提供信息的能力差异。