论文

XREPOTEST:大语言模型 的多语言存储库级单元测试生成基准测试

XREPOTEST: Benchmarking Multilingual Repository-Level Unit Test Generation for Large Language Models

模型评测基准与评测资源

摘要

大语言模型 (LLM) 已显示出自动化单元测试生成的前景,但现有的评估很大程度上依赖于独立设置和一组狭窄的编程语言,高估了现实世界的准备情况。我们推出了 XREPOTEST,这是一个用于单元测试生成的多语言存储库级基准,涵盖五种尚未开发的语言:Rust、Go、Julia、PHP 和 Ruby。 XREPOTEST 使用容器化执行框架和多种上下文增强策略(包括文件级、基于 LSP 和基于检索的上下文)在实际存储库约束下评估测试。除了测试通过率和覆盖率等标准指标之外,我们还建议调用率 (IR) 来评估生成的测试是否有意义地执行预期功能。对 14 个最先进的 LLM(包括 Claude 4.5、GPT-5.2、DeepSeek V4-Pro 和 Qwen 系列)进行的实验揭示了独立​​和存储库级性能之间的巨大差距,以及更丰富的上下文和测试可靠性之间的权衡。总体而言,XREPOTEST 提供了一个具有挑战性且信息丰富的基准,可以在现实软件环境中推进可扩展且强大的单元测试生成。数据集和代码可公开获取:https://github.com/solis-team/XRepoTest