论文
Dialogue SWE-Bench:对话驱动的基准 编码智能体
Dialogue SWE-Bench: A Benchmark for Dialogue-Driven Coding Agents
摘要
AI 编码智能体 迅速改变了软件工程,为广泛使用的交互式编码助手提供支持。尽管它们在现实世界中进行交互使用,但现有的基准测试将它们评估为完全自主的系统。在这项工作中,我们引入了 Dialogue SWE-Bench,这是一个自动基准数据集,用于评估 编码智能体 通过与用户对话解决现实世界软件工程问题的能力。我们设计了一种新颖的、基于角色的用户模拟器来支持我们的任务评估,并通过对话质量的自动评估来增强我们的任务评估。我们还提出了一种新的模式引导代理,旨在提高现成的 编码智能体 的对话能力,它比强基线提高了 3-14%。我们的结果表明,更好的编码模型并不总是对应于更好的对话模型,这表明对话能力是 编码智能体 性能的一个独特且目前尚未得到充分研究的维度。