从代理行为到代理友好的文档:编码智能体 如何发现、阅读和编写技术文档的实证研究
From Agent Behaviour to Agent-Friendly Documentation: An Empirical Study of How Coding Agents Discover, Read, and Write Technical Documentation
摘要
技术文档是为人类开发人员编写的,但现在越来越多的软件更改是由自主的 编码智能体 编写的。他们查阅了哪些文件、何时查阅以及接下来的内容仍然未知。我们对两个公共数据集的代理与文档交互进行了基于行为的研究:来自 SWE-chat 的 557 个代理编码会话,产生了 94,813 个开发事件,其中包括 3,033 个文档交互;来自 AIDev 的 33,097 个代理拉取请求,以及 690,260 个分类文件级更改记录。四项发现挑战了当前的文档实践。首先,代理的文档工作主要是面向代理的人工制品:说明文件和工作笔记占所有文档交互的 60.5%,而经典技术文档占 10.6%,API 参考占 1.3%。其次,咨询和代码编辑之间的联系尚未解决:相邻转移概率为 0.002,未调整的三事件提升为 1.05,而阶段调整模型将其置于统一之上(OR 1.33 [1.09, 1.62]);未经调整的文档创建有所提高(提升 1.67),但调整后的间隔包括统一。第三,没有观察到明确的基于文档的验证序列,并且咨询与不太直接的测试相关(提升 0.23,聚类 CI 0.08-0.45;调整后 OR 0.39 [0.25,0.60])。第四,自行发起的咨询 (70.2%) 远多于故障驱动 (7.5%),并且文档跟踪代码:在同时更改两者的多次提交拉取请求中,首先触及代码的频率是其 4.7 倍。从这些痕迹中,我们得出了代理-文档交互的描述性模型,作为一个两瓣循环而不是线性旅程,并表明“代理友好”文档的两个广泛假设的属性 - 可操作性和可验证性 - 缺乏一致的行为支持。我们发布了我们的管道、编码方案和事件级数据。