论文

多服务环境的规范驱动的 DevOps

Specification-Driven DevOps for Multi-Service Environments

模型评测模型能力评测

摘要

大语言模型 (LLM) 越来越多地用于从存储库工件生成可执行软件环境。然而,功能的可执行性并不一定意味着符合架构、安全性、工作流程和生产意图。本研究调查前沿 LLM 是否可以使用存储库内容为多服务应用程序生成 Dockerfile 和 Docker Compose 配置,而无需访问开发人员编写的部署工件。使用确定性端到端 HTTP 预言机和手动结构比较来评估结合了 Python、Node.js、.NET、React、Rust、Java、Redis、PostgreSQL 和 MySQL 兼容基础设施的三个异构存储库。所有三个生成的环境都可以正常运行,尽管其中一个环境需要将 Rust 基础映像从版本 1.85 更新到 1.88。该模型正确地重建了服务拓扑、应用程序端口、基础设施依赖项、服务主机名、后台工作人员、隐藏代理配置和基于文件的 Docker 机密机制。然而,它始终忽略了网络分段、多阶段构建、依赖层缓存、实时重新加载卷、生产前端服务、限制性后端端口策略和跨平台构建逻辑。基于这些观察,该研究正式区分了功能正确性和部署意图保真度之间的区别,并通过分析得出了针对无法从存储库工件中可靠推断的信息的最小显式部署规范。