论文
代码库内存:通过 MCP 进行 LLM 代码探索的基于 Tree-Sitter 的知识图
Codebase-Memory: Tree-Sitter-Based Knowledge Graphs for LLM Code Exploration via MCP
摘要
大语言模型 (LLM) 编码智能体 通常通过重复文件读取和 grep 搜索来探索代码库,每个查询消耗数千个标记,而无需了解结构。我们提出了 Codebase-Memory,这是一个开源系统,它通过模型上下文协议 (MCP) 构建持久的、基于 Tree-Sitter 的知识图,通过具有并行工作池、调用图遍历、影响分析和社区发现的多阶段管道解析 66 种语言。在 31 个现实存储库中进行评估后,Codebase-Memory 的答案质量达到了 83%,而文件探索代理的答案质量为 92%,而词元数量减少了 10 倍,工具调用数量减少了 2.1 倍。对于集线器检测和呼叫者排名等图本机查询,它在 31 种语言中的 19 种语言上匹配或超过了浏览器。