论文
DoGBench:Agent能否满足面向用户文档的专家标准?
DoGBench: Can Agents Meet Expert Standards for User-Facing Documentation?
摘要
据我们所知,我们引入了 DoGBENCH(文档生成基准),这是用于生成和维护真正面向用户的软件文档的第一个基准。它询问Agent是否可以制作经验丰富的技术作者在审查时接受的文档。该基准测试包含来自开源项目的 292 个项目,包括 Helm、PostHog 和 Mautic。每个项目都为Agent提供了一个预更改存储库和一个触发器,例如代码拉取请求或报告的文档差距。Agent必须首先决定文档是否需要更新。对于需要补丁的项目,Agent必须一次性制作出可接受的补丁。对于不需要更新的项目,Agent商必须弃权。经过项目维护人员验证的特定任务的评分标准,对每个补丁的准确性、完整性、读者指导、放置和存储库约定进行评分。综合分数结合了补丁质量和正确弃权,100 分意味着Agent满足任务的所有要求。分数不应被解释为专家能力的百分比。我们评估了七名Agent。在 117 个项目中,得分最高的Agent达到了 47.3 分(满分 100 分)。在对 1,267 个补丁进行的单独审核中,最常见的故障模式是任务完成差距 (45.5%)、技术不准确 (36.6%) 以及概念或参考覆盖不完整 (32.5%)。对相应轨迹的分析确定了与这些失败相关的三种关键模式:(1)在不检查读者如何使用界面的情况下描述界面(36.0%),(2)缺少决定性证据并用合理的假设填补空白(33.1%),以及(3)在找到第一个合理的文档表面后停止并使其他受影响的页面过时(30.1%)。