论文
IaC-Guard-V:LLM 生成的基础设施即代码修复的验证框架
IaC-Guard-V: A Verification Framework for LLM-Generated Infrastructure-as-Code Repairs
摘要
基础设施即代码 (IaC) 错误配置是云安全事件的主要原因,大型语言模型 (LLM) 越来越多地被提议作为自动修复代理。然而,LLM 生成的 IaC 修复的可信度仍未得到充分探索。 IaC 提出了独特的验证挑战:安全扫描器在不同的工具和配置中可能表现不同,基础设施语义无法通过普通的单元测试进行验证,并且特定于提供商的规则创建了碎片化的验证环境。我们提出了 IaC-Guard-V,一个以验证为中心的框架,它通过四个维度评估 AI 生成的 IaC 修复:语法有效性、目标问题解决、回归安全性和补丁最小化。我们构建了 70 个现实世界中错误配置的 Terraform 和 Kubernetes 工件的基准,涵盖 70 个独特的扫描器规则和 8 个违规类别,并在 630 次运行中评估了三个 LLM 系列的三种修复策略。尽管所有模型都实现了 100% 语法有效性,但只有 32-50% 的单次修复通过了全面验证。验证引导的迭代修复将验证修复率显着提高至 68-92%。具有验证引导修复功能的开源模型的性能优于未经验证的最强商业模型,每次验证修复的成本仅为其十二分之一。商业模型的 Kubernetes 修复率接近完美,但开源模型需要验证引导的迭代。结构化提示持续降低 Terraform 修复质量,挑战有关 LLM 输出受限的常见假设。发布基准和工件是为了确保可重复性。