论文

重新排序前回忆:大规模代码到代码检索的深度学习模型基准测试

Recall Before Rerank: Benchmarking Deep Learning Models for Large-Scale Code-to-Code Retrieval

模型评测模型能力评测

摘要

语义代码搜索和克隆检测对于软件开发、维护和重用至关重要。本文评估了大规模代码到代码搜索引擎中第一阶段召回的当代深度学习模型的有效性、效率和可扩展性。跨多种编程语言和数据集的基准测试揭示了这些模型在 TB 级源代码集合上的精度和可扩展性的关键限制。我们提出了基于 LLM 的代码规范化和查询重写方案,可以显着提高性能较低模型的精度。我们的结果质疑资源受限部署的可持续性以及当前代码专用 LLM 跨数据集的假设稳健性。最后,我们提出了构建可扩展、高效的代码检索系统的可行见解。