论文
Code2UML:具有上下文工程的 Agentic LLM,用于可扩展的软件可视化
Code2UML: Agentic LLMs with context engineering for scalable software visualization
摘要
采用基于大语言模型(LLM)的代码分析工具来自动化软件文档任务。然而,这些方法对实际代码库的可扩展性(其中中间表示(IR)超过 LLM 上下文限制)仍未得到充分探索。本文介绍了一种具有上下文工程的代理架构,用于从源代码存储库自动生成 UML 图。它采用五个专门代理的层次结构:PlannerAgent、AnalyzerAgent、DiagramAgent、CorretorAgent 和 DependencyAnalyzerAgent,基于 Claude Agent SDK 构建,每个代理处理不同的认知子任务。确定性、重要性加权的 IR 压缩层将完整的项目 IR 转换为特定于图表的视图,保证符合词元约束,无需 LLM 调用并在几毫秒内完成。因此,我们使用 4 种编程语言(Java、JavaScript、PHP、Python)和 7 种 UML 图类型跨 12 个开源存储库评估系统,产生了根据 5 个自动化指标评估的 84 个观察结果。结果表明,语法有效性高(平均值:91.5%,组件图和部署图达到 100%)、关系精度高(平均值:0.858)和结构质量一致(平均值:81.7/100,跨语言方差为 3.1 分)。实体召回率平均为 0.313,反映出深思熟虑的架构优先级高于详尽的覆盖范围。敏感性分析(31 至 4,578 个 IR 实体)证实,无论规模如何,质量得分都保持稳定。