论文

CoSTAR:用于遗留系统现代化的数据合成驱动的约束感知 COBOL 部分摘要

CoSTAR: Data Synthesis-Driven Constraint-Aware COBOL Section Summarization for Legacy System Modernization

模型训练合成数据

摘要

COBOL 对于政府、金融机构和大型企业仍然至关重要;然而,技术老化、专业知识萎缩和文档缺失使得基于 COBOL 的遗留系统的现代化变得越来越紧迫。在迁移之前,代码摘要是支持遗留系统理解的常见做法。然而,COBOL 代码摘要,特别是在节级别上,面临两个关键挑战:数据稀缺和迁移约束保留。为了应对这些挑战,我们提出了 CoSTAR,这是一个集成框架,它将执行验证的数据合成与约束感知的 模型训练 相结合。 CoSTAR 重新利用通用编程任务,通过基于 LLM 的生成来合成经过执行验证的 COBOL 代码摘要数据,从而克服数据稀缺的问题。基于合成数据,CoSTAR 通过相关数据声明和自然语言解释来增强目标部分,并使用约束引导的结构化原理来训练较小的基础 LLM。训练后的 LLM 保留 COBOL 部分摘要的迁移约束。我们在公共和机密企业 COBOL 系统上评估 CoSTAR。 CoSTAR 有效地综合了 3,764 个经过执行验证的训练实例。基于这些实例,基于 7B/8B 基础 LLM 构建的 CoSTAR 可以改进这些 LLM,在 ROUGE-L 上平均相对增益为 25.38%,在 METEOR 上平均相对增益为 53.84%,在 chrF 上平均相对增益为 37.22%。在实际企业评估中,CoSTAR仅基于Qwen3-8B构建,在准确性、完整性和简洁性方面优于企业部署的Qwen3-235B。这些结果表明,对于隐私敏感的 COBOL 遗留系统,CoSTAR 使小型、可本地部署的 LLM 能够实现与更大的 LLM 相媲美的性能。