论文

CodeMMR:桥接自然语言、代码和图像以实现统一检索

CodeMMR: Bridging Natural Language, Code, and Image for Unified Retrieval

上下文与知识检索增强

摘要

代码搜索,以信息检索 (IR) 为框架,支撑着现代软件工程,并日益增强检索增强生成 (RAG),从而改善代码发现、重用以及基于 LLM 的编码的可靠性。然而,现有的代码 IR 模型仍然主要以文本为中心,并且经常忽略编程工件(例如 Web 界面、数据可视化、SVG、示意图和 UML)中固有的视觉和结构方面。为了弥补这一差距,我们引入了 MMCoIR,这是第一个用于评估跨五个视觉域、八种编程语言、十一个库的多模式代码 IR 的综合基准,并通过广泛的评估展示了该任务的挑战。因此,我们提出了 CodeMMR,一种统一的检索模型,通过基于指令的多模态对齐将自然语言、代码和图像联合嵌入到共享语义空间中。 CodeMMR 实现了跨模式和语言的强大泛化,在 nDCG@10 上比竞争基线(例如 UniIR、GME、VLM2Vec)平均高出 10 个点。此外,将 CodeMMR 集成到 RAG 中可以增强代码生成保真度和未见过的代码生成任务的视觉基础,强调多模态检索作为下一代智能编程系统核心推动者的潜力。数据集可在 HuggingFace 上获取。