论文
提交之间:完全由人工智能编写的代码库中的流程、错误和声明可靠性
Between the Commits: Process, Error, and Claim Reliability in a Wholly AI-Authored Codebase
摘要
我们提出:(i) 一个新数据集,包含完全由 Claude AI 构建的 21,000 行 Python 工具的完整开发历史,没有人工编写的代码或测试,(ii) 两个代码来源跟踪工具,(iii) 指令意图、提交来源和响应可靠性的三种分类法,(iv) 应用这些分类法来分析数据集。我们发现:(i) 用户编码代理 CLI 指令与 IDE 聊天指令在类型上有所不同,更注重理解、规划和咨询,(ii) 代码开发主要是主动的,(iii) 14.3% 的 AI 代码生成事件包含后来被 AI 编写的测试套件捕获的真实错误,(iv) 大约四分之一的 AI 交互响应包含一个或多个事实错误。