论文

EvalLoop:一种评估驱动的商业人工智能系统迭代改进方法

EvalLoop: A Methodology for Evaluation-Driven Iterative Improvement of Business AI Systems

模型评测评测方法与指标

摘要

在业务环境中部署 大语言模型 的团队需要评估系统,但大多数将评估视为静态模型选择:运行基准、对模型进行排名、部署获胜者。这种框架忽略了评估对生产系统的主要价值——诊断系统性能不佳的原因并指导修复问题。我们提出了 EvalLoop,一种评估驱动的迭代改进方法。 EvalLoop 围绕三种机制组织评估:(1)维度度量分组,将质量分解为与业务相关的维度,从而实现正交故障诊断; (2) 故障模式分类,对弱维度内输出失败的原因进行分类,将诊断与行动联系起来; (3) 结构化迭代工作流程,其中每次评估运行都会改变一个系统变量,并比较前后的尺寸轮廓。我们通过销售智能简报生成的案例研究(10 个模型、3 个提供商、18 个指标、5 个维度、3 次迭代)来验证 EvalLoop。维度诊断发现,69% 的幻觉失败是由提示引起的解释错误——在总评分中是不可见的。有针对性的提示修复将最佳模型总体从 82.6% 提高到 94.6%,改进集中在诊断维度(内容准确性 +16.8pp,综合能力 +26.4pp)。先前迭代中的无向配置更改产生了零影响,说明了在没有诊断的情况下进行迭代的成本。我们还证明,维度分析可以实现特定于部署的模型选择,并且决赛入围小组(4 个模型,16 个案例)上的一次性盲人门可以确认维度排名,同时解决多标准部署权衡 - 与评估完整设计相比,审查负担减少 94%。 EvalLoop 被打包为可重用的工件(剧本、代理规范、模板存储库)以供其他团队采用。