论文
SWE-InfraBench:评估云基础设施代码上的语言模型
SWE-InfraBench: Evaluating Language Models on Cloud Infrastructure Code
摘要
在云计算中构建基础设施即代码 (IaC) 是一项关键任务,它支撑着现代软件系统的可靠性、可扩展性和安全性。尽管 大语言模型 (LLM) 在软件工程方面取得了显着进步(在许多专用基准测试中得到了证明),但它们开发 IaC 的能力仍未得到充分开发。现有的 IaC 基准主要以 Terraform 等声明性范例为中心,并涉及从头开始生成整个代码库,而我们的基准则不同,它反映了使用 AWS CDK 等命令式工具进行企业开发中常见的增量代码编辑。我们推出了 SWE-InfraBench,这是一个源自数十个现实世界 IaC 代码库的多样化评估数据集,挑战 LLM 在 AWS CDK 存储库中执行实际的代码修改。每个示例都需要模型根据自然语言指令实现对现有代码库的更改,并通过提供的测试用例来确定成功。这些任务需要对云资源依赖性和实现模式进行复杂的推理,超越传统的代码生成挑战。我们的评估结果揭示了当前 LLM 的显着局限性,表明即使是最先进的系统也难以完成许多任务 - 最好的模型 Sonnet 3.7 仅在 34% 的情况下成功,而像 DeepSeek R1 这样的专门推理模型仅取得 24% 的成功。 SWE-InfraBench 数据集位于:https://www.kaggle.com/datasets/64e59070fd51c0278560b01eb5dc4f3c447d5268cdabe5a350d2969e4413fea5