论文

Doc2CI:使用 大语言模型 生成 CI 配置的多服务研究

Doc2CI: A Multi-Service Study of CI Configuration Generation Using Large Language Models

模型评测基准与评测资源

摘要

采用持续集成 (CI) 通常需要编写容易出错且难以维护的 YAML 配置。尽管 LLM 在软件工程中的使用越来越多,但它们跨服务和模型系列从自然语言生成 CI 配置的能力仍不清楚。本文提出了关于使用 LLM 生成 CI 配置的大型实证研究。我们引入了 DOC2CI,这是从四个 CI 服务的官方文档中收集的 3,363 个描述到 YAML 对的基准,并根据 7B-34B 参数以及 GPT-4o 和 GPT-4.1 评估了 14 个开放权重模型,生成了超过 53,000 个配置。我们评估参考对齐和模式有效性,以确定生成的配置在结构上是否有效。我们通过对 385 个配置的手动分析进一步开发了故障分类法,并研究了 LLM 不同意的原因。在模型和服务中,精确的引用复制从未超过 3.1%,虽然 97% 的输出解析为 YAML,但只有 71% 满足服务模式。较大的模型可以提高结构有效性,但代码专业化与可比较的通用模型相比并没有提供一致的优势。模型差异很大程度上是由输出完整性驱动的:对于相同的请求,一些模型生成预期的片段,而另一些模型则生成完整的工作流程。最后,无需训练 模式引导修复方法将模式有效性提高到 94%,而 微调 提高了与文档的相似性,但降低了独立有效性。这表明相似性和有效性是 CI 生成的不同目标,并激发基于 LLM 的配置生成的模式感知评估和工具。