论文

评估企业自动化的 LLM 权衡:生产企业平台中工作流生成的经验教训

Evaluating LLM Trade-offs for Enterprise Automation: Lessons from Workflow Generation in a Production Enterprise Platform

模型推理推理策略与问题分解

摘要

企业合规管理需要快速适应不断发展的监管框架(例如 DORA、AI RMF、FedRAMP)和严格的补救 SLA。传统的静态编排器通常在混合云环境中失败,在混合云环境中,事件驱动的评估要求自动化代码在几秒钟内适应运行时上下文。本文介绍了在生产企业平台中评估用于 AI 驱动的工作流生成的 6 个 大语言模型 的经验教训,针对 29 个现实 IT 自动化场景、两代管道架构以及每个提示模型管道配置的 8 次独立运行(总共 2,784 次运行)进行了基准测试。我们最初的管道使用整体工作流程生成,实现了 31.5-82.8% 的结构成功率(JSON 模式有效性和正确的 UI 渲染),而大多数模型都在复杂的 JSON 生成上苦苦挣扎。我们开发了重新设计的分段管道,将工作流程构建分解为可变脚手架、基础块组装和嵌套块生成,将所有模型的结构成功率提高到 74.1-97.8%。我们分析了生产权衡,包括成本(每个工作流程 0.008-0.20 美元)、延迟(交互式使用低于 50 秒)和模型选择。分段分解使较小的模型(例如,mistral-small 的结构成功率为 95.7%,每个工作流程 0.01 美元)达到生产可行性,消除了对昂贵的前沿模型的依赖。虽然 mistral-medium-2505 和 gpt-oss-120b 取得了最高的结构成功率(96.1% 和 97.8%),但 mistral-medium-2505 的成本溢价是 mistral-small 的 19 倍。我们的部署课程强调需要将结构有效性与语义正确性(用户意图的逻辑实现)分开,并为云工程中与模型无关的可扩展自动化提供解决方案。