论文

通过问答和功能驱动开发评估存储库级软件文档

Evaluating Repository-level Software Documentation via Question Answering and Feature-Driven Development

摘要

软件文档对于理解存储库至关重要。虽然 大语言模型 (LLM) 推进了从代码片段到整个存储库的文档生成,但现有基准测试有两个主要局限性:(1) 它们缺乏整体的存储库级别评估,(2) 它们依赖于不可靠的评估策略,例如 LLM-as-a-judge,该策略受到模糊标准和有限的存储库级别知识的影响。为了解决这些问题,我们引入了 SWD-Bench,这是一种用于评估存储库级软件文档的新颖基准。受文档驱动开发的启发,我们的策略通过评估 LLM 使用文档理解和实现功能的能力来评估文档质量,而不是直接评分。这是通过功能驱动的问答 (QA) 任务来衡量的。 SWD-Bench 包含三个相互关联的 QA 任务: (1) 功能检测,以确定是否描述了功能; (2)功能定位,评估定位相关文件的准确性; (3)功能完成度,衡量实现细节的全面性。我们通过挖掘高质量的拉取请求并使用存储库级上下文丰富它们来构建包含 4,170 个条目的基准。实验揭示了当前文档生成方法的局限性,并表明源代码提供了补充价值。值得注意的是,性能最佳方法的文档将 SWE-Agent 的问题解决率提高了 20.00%,这证明了高质量文档在支持文档驱动开发方面的实用价值。