论文
使用启发式和开源 LLM 从源代码中自动提取域模型
Towards Automated Domain Model Extraction from Source Code using Heuristics and Open-Source LLMs
摘要
大语言模型 (LLM) 最近表现出了强大的代码理解能力,这使得它们有望从源代码进行逆向工程领域模型。然而,由于隐私和机密性限制,最先进的专有 LLM 无法在许多工业环境中使用,而可以在本地运行的紧凑型开源 LLM 受到其上下文窗口的限制,无法直接处理大型代码库。在本文中,我们提出了一种使用轻量级、可本地部署的 LLM 从源代码中提取域模型的自动化方法。我们的方法将结构和语义启发式与基于 LLM 的迭代推理相结合,以克服上下文限制。通过逐步分析代码元素的排序子集,该方法可以识别领域概念并细化领域边界,而无需完整的系统上下文。我们的方法在包含 10 个项目的数据集上获得了高 F1 分数,每个项目都包含一个精选的域模型及其相应的实现,同时在本地可部署的 LLM 上保持完全可执行。这使得它特别适合隐私敏感的工业环境中的逆向工程任务。