论文
ReCUBE:评估代码生成中存储库级上下文的利用率
ReCUBE: Evaluating Repository-Level Context Utilization in Code Generation
摘要
大语言模型 (LLM) 最近成为强大的编码助手,可以通过代理探索或全上下文生成在大型代码库上运行。现有的基准测试捕获了广泛的编码功能,例如解决 GitHub 问题,但它们都没有直接隔离和测量 LLM 在代码生成过程中如何有效地利用存储库级上下文。为了解决这个问题,我们引入了 ReCUBE,这是一个基准测试,其中 LLM 使用所有剩余的源文件、依赖项规范和文档作为唯一的上下文来源,在现实存储库中重建屏蔽文件。 ReCUBE 使用使用感知测试用例来评估重构的代码,这些测试用例模拟内部模块逻辑和外部跨文件集成,反映真实世界的软件使用模式。我们进一步提出了以调用者为中心的探索(CCE)工具包,这是一组基于依赖图的工具,可以集成到代理框架中,以在存储库探索期间引导代理找到最相关的调用者文件。在四种设置下的八个模型上进行的实验表明,即使对于最先进的模型,存储库级上下文利用率仍然极具挑战性,GPT-5 在全上下文设置中仅实现 37.57% 的严格通过率。使用我们的 CCE 工具包增强的代理在所有评估模型中始终优于所有基线,严格通过率提高高达 7.56%。我们以开源方式向 NLP 研究社区发布基准、代码和评估框架。