论文

超越向量相似性:分层上下文感知图RAG与标准RAG在企业代码迁移中的对比

Beyond Vector Similarity: Hierarchical Context-Aware Graph RAG vs Standard RAG in Enterprise Code Migration

摘要

随着企业将传统单体系统迁移到微服务架构,大语言模型被广泛用于自动化代码翻译。然而,传统的基于向量的检索增强生成(标准RAG)难以捕捉拓扑关系,其获取的孤立代码片段切断了继承链,导致编译失败率较高。本文提出了一种分层上下文驻留图(HCRG)方法来解决这些问题。我们的流程使用Tree-sitter提取抽象语法树(AST),将架构边映射到Google Cloud Spanner属性图,并将该结构序列化为Gemini上下文缓存,以实现拓扑结构和父级优先的代码翻译。我们评估方式从简单的文本重叠转向定制的7项软件工程框架。传统指标如CodeBLEU(两种方法均得91%)掩盖了标准RAG在结构上的缺陷,其生成的代码在语法上合理但实际不可用。实验表明,图RAG显著缓解了依赖丢失问题:API幻觉率从56.4%降至16.2%,依赖解析质量从34.8%提升至65.9%,父-子一致性从26.7%提升至45.5%。然而,图RAG也引入了特定权衡:密集的全局上下文导致大语言模型产生防御性过度工程,使圈复杂度一致性从71.6%下降至46.7%,文档字符串保留率也从67.0%降至61.0%。最终,尽管以牺牲代码复杂性为代价降低了幻觉,图RAG为自动化企业代码库现代化提供了更可行且架构上更稳健的路径。