论文
FDE-Bench:评估 LLM 代理的部署环境配置
FDE-Bench: Evaluating LLM Agents for Deployment Environment Configuration
摘要
部署需要代理将应用程序代码转换为正在运行的系统,该系统的服务已连接、准备就绪并保持可观察性。 FDE-Bench 在绿地模式和诊断修复模式下通过 136 个跨 Docker 映像、多服务 Compose 堆栈和 Kubernetes 的部署配置任务来评估此功能。代理提交在原始环境中收集、重建和重新部署的声明性工件。四个门控二进制检查层使用无需 LLM 判断的编程检查来衡量构建、准备情况、行为以及对部署规范的一致性。四臂发布门需要一个解决参考解决方案,并拒绝通过无所事事、规范转录或通用存根提交解决的任务。已发布的检查注释公开了 2,145 个检查及其规范之间的链接,其中包括七个已记录的差距。另外三种对抗策略测试评分信号中的捷径;没有一个能够解决它们所涵盖的 135 项任务中的任何一项,而空洞的运行状况探测则通过了就绪状态并暴露了下游检查的需求。在 136 个任务评估网格上,来自四个提供商的七个语言模型使用相同的四个工具支架,并解决了 52.9-75.0% 的任务。三个零智能层无法解决任何问题,平均部署得分最多为 0.44。准备阶段是最大的失败阶段,占 313 个未解决事件中的 110 个。修复任务组的平均解决率比不相交的绿地组高 30.7 个百分点,每个模型都有正差距;十项任务抵挡所有七项任务。在一项包含 25 项任务的案例研究中,一位指导 Claude-Sonnet-5 的实践工程师解决了 92% 的问题,而自主基线的解决方案为 72%。 FDE-Bench 将部署成功和失败与可检查和重放的工件联系起来。