论文

EnterpriseVal:量化生成式AI在企业中的效能、可靠性与价值

EnterpriseVal: Quantifying the Efficacy, Reliability and Value of Generative AI in the Enterprise

模型评测评测方法与指标

摘要

前沿语言模型如今产出的专业交付物,在相当比例具有经济价值的任务上被专家评审判定媲美人类作品,然而大多数企业GenAI举措未能展现可度量的业务效果,且大量Agentic项目预计将被取消。我们认为这在很大程度上是一个测量问题:公开基准回答的是模型能做什么,而部署决策需要回答的是——这个工作流是否适配、可靠、安全并值得扩展,在此地、在我们的数据上、在我们的管控之下?我们提出EnterpriseVal,一个用例级评估系统来弥合这一差距。它包括:(i)用例及被测冻结社会技术配置(模型、提示、检索、工具、护栏与人类监督)的形式化规范,配有自主级别与后果层级,共同决定所需的评估强度;(ii)涵盖保真度、效用、效率、可靠性、保障与监督的指标目录;(iii)通过预测驱动推断以校准的LLM-as-judge评分扩展盲评专家判断的评分协议;(iv)以可执行算法表述的两层阈值门,将带置信界的指标向量映射为REJECT/CONDITIONAL/SCALE决策;(v)将评审员捕获率作为实测参数的价值与风险模型。我们报告在一家全球银行的三个工作流上的试点:在信贷备忘录起草中,最佳模型的人工评分引用精确率达88%、幻觉率1.6%,对应门槛为70%与5%;在流程转换中,分析师的精修工作量从估计的每份文档27.4小时降至2.9小时。我们区分了既有结果、有据可查的试点证据、所提系统与开放假设,并给出完整验证所需的实验。

EnterpriseVal:量化生成式AI在企业中的效能、可靠性与价值:论文配图
图 1:公开基准与企业决策之间的两个鸿沟。能力基准衡量模型在可迁移任务上的表现,而企业还必须确立向自身工作流与真值(ground truth)的迁移(鸿沟 1),并将质量指标转化为治理机构可据以行动的价值与风险论证(鸿沟 2)。