论文

SWE-chat:来自真实用户真实场景的编码智能体交互

SWE-chat: Coding Agent Interactions From Real Users in the Wild

模型评测基准与评测资源

摘要

AI编码智能体正在被大规模采用,但关于人们实际如何使用它们、其产出中有多少在实践中真正有用,我们仍缺乏实证证据。我们提出SWE-chat,这是首个从开源开发者真实使用中收集的大规模编码智能体会话数据集。该数据集目前包含6,000个会话,涵盖超过63,000条用户提示和355,000次智能体工具调用。SWE-chat是一个持续更新的活数据集;我们的收集流水线会自动、持续地从公开仓库中发现并处理会话。利用SWE-chat,我们对真实世界中编码智能体的使用模式和失败模式给出了初步的实证刻画。我们发现编码模式呈双峰分布:在41%的会话中,智能体撰写了几乎所有最终提交的代码(“vibe coding”),而在23%的会话中,代码完全由人类自己编写。尽管能力快速提升,编码智能体在自然场景中仍然效率低下。智能体生成的代码中仅有44%最终留存于用户提交中,且智能体编写的代码比人类编写的代码引入更多安全漏洞。此外,在全部对话轮次中有44%出现用户对智能体输出的反馈抵制——通过纠正、失败报告和中断等方式。通过捕获完整交互轨迹并标注代码由人类还是智能体撰写,SWE-chat为超越精心策划的基准、基于证据地理解AI智能体在真实开发者工作流中的表现提供了实证基础。

SWE-chat:来自真实用户真实场景的编码智能体交互:论文配图
图 1:我们展示了 SWE-chat,这是一个从公共 GitHub 存储库收集的真实人类编码代理交互的不断增长的数据集。开发人员通过安装 Entire.io 来选择加入,Entire.io 是一个开源工具,可以自动记录编码代理会话,并将它们链接到具有行级人工与代理归因的代码提交。截至 2026 年 4 月,SWE-chat 包含来自 200 多个存储库的 270 万条记录事件,其中包括 63,000 多个用户提示和 355,000 多个工具调用。