论文

编译 AI:基于 LLM 的工作流自动化的确定性代码生成

Compiled AI: Deterministic Code Generation for LLM-Based Workflow Automation

摘要

我们研究编译型 AI,这是一种范例,其中 大语言模型 在编译阶段生成可执行代码工件,之后工作流程确定性执行,无需进一步调用模型。该范式在声明式管道优化 (DSPy) 和混合神经符号规划 (LLM+P) 的先前工作中有先例;我们的贡献是对其在高风险企业工作流程中的应用进行面向系统的研究,特别强调可靠性和可审计性至关重要的医疗保健环境。通过将生成限制为嵌入在经过验证的模板中的狭窄业务逻辑功能,编译后的人工智能以运行时灵活性换取了可预测性、可审计性、成本效率和减少的安全风险。我们引入了(i)用于基于 LLM 的受约束代码生成的系统架构,(ii)将概率模型输出转换为生产就绪代码工件的四阶段生成和验证管道,以及(iii)衡量运营指标的评估框架,包括词元摊销、确定性、可靠性、安全性和成本。我们评估两种任务类型:函数调用(BFCL,n=400)和文档智能(DocILE,n=5,680 张发票)。在函数调用方面,编译后的 AI 在零执行词元的情况下实现了 96% 的任务完成率,在大约 17 个事务时与运行时推理持平,并在 1,000 个事务时将词元消耗减少了 57 倍。在文档智能方面,我们的 Code Factory 变体在关键字段提取方面与 Direct LLM 相匹配(KILE:80.0%),同时实现了最高的行项目识别准确度(LIR:80.4%)。对 135 个测试用例进行的安全评估表明,即时注入检测的准确度为 96.7%,静态代码安全分析的准确度为 87.5%,且误报率为零。