论文
代理人工智能编码工具配置数据集
A Dataset of Agentic AI Coding Tool Configurations
摘要
Claude Code 和 OpenAI Codex 等代理 AI 编码工具在有限的人工监督下执行多步骤编码任务。为了引导这些工具,开发人员为上下文文件、技能、规则和挂钩等配置机制创建存储库级配置工件(例如 Markdown 文件)。目前还没有精心策划的数据集可以大规模捕获这些配置。从开源 GitHub 存储库收集的该数据集填补了这一空白。我们通过元数据过滤选择了 40,585 个主动维护的存储库,使用 GPT-5.2 对它们进行分类,以识别出 36,710 个属于工程软件项目,并系统地检测这些存储库中的配置工件。该数据集涵盖五种工具(Claude Code、GitHub Copilot、OpenAI Codex、Cursor、Gemini)和八种配置机制的 4,738 个存储库。我们收集了 15,591 个配置工件、与这些配置工件相关的 18,167 个配置文件的完整内容以及 148,519 个 AI 共同创作的提交。数据集和构建流程可在 Zenodo 上以 CC BY 4.0 的形式公开获取。交互式网站允许研究人员浏览和探索数据。这些数据支持上下文工程、人工智能工具采用模式和人机协作的研究。