论文

用于基础设施即代码生成的 Agentic LLM 的验证者优先评估

Verifier-First Evaluation of Agentic LLMs for Infrastructure-as-Code Generation

智能体系统智能体互操作协议Agent任务评测MCP

摘要

从自然语言生成基础设施即代码(IaC)需要满足提供者模式、依赖规划和组织策略约束,而不仅仅是生成语法上合理的配置。我们提出了一项验证者优先的实证研究,涉及在 IaC-Eval v2 上评估的 Terraform 生成的七种代理策略,IaC-Eval v2 是一个现代化的 186 任务 AWS/Terraform 基准,具有 Rego v1 意图策略。我们的评估将失败分为三个验证阶段(terraform 验证、terraform 计划、opa 评估),并在所有成对比较中应用带有 Wilson 置信区间的 McNemar 检验(n=186,alpha=0.05)。我们报告了五项主要发现。 (1) 通过 ReAct 代理与 MCP 或 ChromaDB 支持的 RAG 进行主动检索,将 Qwen2.5-Coder 7B 通过@1 从 14.0% 提高到 45.7%(p<0.0001),主要是通过将 VALIDATE_FAIL 从 144 个任务减少到 66 个任务。 (2) 利用验证者反馈进行迭代细化,通过率达到 62.9% (Qwen 7B) 和 84.4% (GPT-4o) pass@1,表现出二元收敛——任务要么在一次重试中解决,要么耗尽预算。 (3) GEPA 反射指令优化仅使用 80条验证器引导的采样轨迹,就将 Active RAG 基线提高了 +7.5 pp (p=0.026),这提供了证据表明提示优化器可以在不更新权重的情况下改进可验证的 IaC 生成。 (4) SIMBA 无教师演示注入在没有检索基础设施的情况下实现了与 Active RAG (p=1.0) 相当的性能,但无法解决主要的 SELF_DEFINED_PROPERTY 错误类(50% 的失败)。 (5) 诊断性 Rego 注入实验表明,当策略文本可见时,79% 的细化后 OPA 故障是可解决的信息差距故障 (p=0.016),从而激励政策