论文

CORE-Bench:面向编码智能体的代码检索评测

CORE-Bench: A Comprehensive Benchmark for Code Retrieval in the Era of Agentic Coding

模型评测基准与评测资源

摘要

编码智能体需要根据需求查找具体仓库中的文件与函数,收集上下文并过滤相似但无关的内容,超出查询与独立代码片段匹配的传统代码搜索。CORE-Bench针对这一需求,从代码理解、问题到修改位置定位和扩展上下文检索三个层面评测,结合精选代码搜索任务与SWE-bench系列实例,包含超过18万查询和10.6万条扩展上下文相关性标注。代表性嵌入模型从传统代码搜索转向智能体编码检索时,表现明显下降;对现有嵌入模型进行简单监督微调可显著改善这一设置下的表现。