论文

用于科学代码理解的检索增强生成

Retrieval-Augmented Generation for Scientific Code Understanding

上下文与知识检索增强

摘要

大型语言模型已成为现代编码助手的核心,但 Claude Code 或 Codex 等最先进的系统依赖于非常大的云托管模型,这些模型具有巨大的计算成本和数据隐私影响。这项工作研究了是否可以通过将计算负担从推理中转移出来,围绕小型开源模型构建有用的、完全本地的编码代理。我们开发了一个用于科学代码理解的检索增强生成(RAG)系统,该系统将昂贵的离线摄取阶段解析、结构图构建、LLM生成的实体解释以及嵌入与轻量级在线回答阶段严格分开。该系统在用 C++ 编写的 IPPL 科学代码库上跨越 11 个类别的 100 个问题基准进行评估,并由独立前沿模型作为评委对答案进行评分。在七个回答模型中,我们发现模型系列和检索质量比参数数量更重要,即 9B 模型获得了最高的平均分数 (0.795),优于我们管道中的较大模型和嵌入 Claude Code 检索架构中的相同模型。结果表明,将代码理解预先加载到可重用的、代码库专用的向量存储中,使得小型本地模型能够提供基础的、特定于存储库的答案,从而使该代理非常适合作为内部科学代码库的隐私保护开发工具。