COBOL-Coder:用于 COBOL 代码生成和翻译的域适应 大语言模型
COBOL-Coder: Domain-Adapted Large Language Models for COBOL Code Generation and Translation
摘要
COBOL 仍然是大型机系统的关键语言,但现有的 大语言模型 (LLM) 很难正确生成和翻译 COBOL 代码。本文报告了我们在开发和评估用于 COBOL 和大型机软件工程的领域自适应 LLM 方面的经验。我们引入了 (1) 一个自动数据管理管道,它将编译器引导的验证与基于多阶段相似性的过滤相结合,以构建高质量的 COBOL 训练数据,以及 (2) COBOL-Coder,一个针对管理的 COBOL 域数据进行微调的 COBOL 专用 LLM。我们在两个任务上评估 COBOL-Coder:代码生成(在 COBOLEval 和 COBOLCodeBench 上)和代码翻译(在 COBOL-JavaTrans 上,我们建议的双向 COBOL-Java 翻译基准)。在我们的实验中,COBOL-Coder 在 COBOLEval 上实现了高达 73.95% 的编译成功率和 49.33 Pass-1,而 GPT-4o 的编译成功率为 41.8% 和 16.4,而大多数开源基线(例如 CodeGemma、CodeLlama、StarCoder2)无法生成可编译的程序。对于 Java 到 COBOL 的转换,COBOL-Coder 的 Pass-1 得分为 34.93,而通用 LLM 的得分接近于零。为了评估 LLM 生成的代码在现实环境中的可用性,我们与经验丰富的 COBOL 开发人员进行了调查。参与者一致反映,COBOL-Coder 比通用 LLM 表现出更强的 COBOL 意识,具有更可靠的程序结构,并且更符合企业实践。