论文

经验软件工程 TerraProbe:用于检测 LLM 辅助 Terraform 中的欺骗性修复的分层 Oracle 框架

Empirical Software Engineering TerraProbe: A Layered-Oracle Framework for Detecting Deceptive Fixes in LLM-Assisted Terraform

模型评测评测方法与指标

摘要

Terraform 基础设施即代码中的安全错误配置是云部署中日益增长的风险,并且 大语言模型 越来越多地用作自动修复代理。当目标静态分​​析发现消失时,现有的评估通常将修复视为成功,而不检查计划的有效性、行为变化或安全意图。本文介绍了 TerraProbe,这是一个用于评估 LLM 辅助 Terraform 安全修复的五层预言机框架。我们将 TerraProbe 应用于由 gemini-2.5-flash-lite、GPT-4o 和 Claude 3.5 Sonnet 在 68 个真实 TerraDS 模块和 28 个受控注入缺陷模块中生成的 288 个首次修复。结果表明,有针对性的 Checkov 删除夸大了修复成功率。虽然主模型的目标去除率达到 83.3%,但全扫描仪清洁度下降至 10.4%,Terraform 规划成功率为 39.6%,计划比较可达 38.5%。人工裁决进一步表明,与计划相比的实际修复中有 71.4% 是欺骗性修复,这些修复通过了自动检查,同时保留了潜在的漏洞。这种模式在统计上在三个模型中无法区分,欺骗性修复率从 57.1% 到 71.4% 不等,成对费舍尔精确 p 值高于 0.10。该论文介绍了欺骗性修复的四维分类法,并使用 0.78 的 Cohen kappa 和 0.76 的 Krippendorff alpha 进行了验证。 IAM 权限分析证实,通配符资源授予在所有 9 个 CKV2 AWS 11 欺骗性修复案例中均持续存在。 TerraProbe 提供了一种评估方法、一个复制包和多层 Oracle 评估框架,用于区分意图一致的安全修复和扫描仪传递的错误成功。