论文

Code-QA-Bench:区分代码理解与文档记忆的仓库问答

Code-QA-Bench: Separating Code Reasoning from Documentation Memorization in Repository-Level QA

模型评测基准与评测资源

摘要

我们提出了 Code-QA-Bench,这是一个完全自动化的框架,用于合成存储库级代码理解基准,将真正的代码理解与文档回忆和预训练记忆分开。该框架做出了两个方法论贡献:(1)答案优先生成管道,配备工具的代理在推导问题之前探索源代码以生成经过验证的黄金答案,确保每个任务都基于真实的代码结构; (2)三条件实验设计,在闭卷(无存储库)、仅代码(删除文档)和含文档(完整仓库)条件下评估智能体,其中增量直接量化文档效用和记忆。我们从 SWE-Bench 的 10 个 Python 存储库中生成了 528 个可推导的代码任务和 100 个依赖于文档的任务,由 LLM 评判器根据准确性、完整性和特异性进行评分。对四个前沿模型的实验表明,代码访问是主导因素(比闭卷平均增益+0.23),文档提供了适度的额外好处(依赖于文档的任务+0.071),并且在可由代码推导的任务上,仅代码条件与含文档条件得分近似,验证了设计。该框架是开源的,适用于任何有完整文档的 Python 存储库。