论文
在真实环境中评估智能体AI:失败模式、漂移模式与生产级评估框架
Evaluating Agentic AI in the Wild: Failure Modes, Drift Patterns, and a Production Evaluation Framework
摘要
现有的大语言模型评估框架——包括HELM、MT-Bench、AgentBench和BIG-bench——是为受控、单会话、实验室规模的环境设计的。它们并未解决智能体AI系统在生产环境中持续运行时出现的评估挑战:复合式决策错误、工具故障级联、非确定性输出漂移,以及长程任务缺乏真值。本文有三项贡献。首先,我们提出生产级智能体系统特有的七种失败模式分类法,每一种都基于对十亿级事件规模系统运行的观察。其次,我们以实证说明标准指标——ROUGE、BERTScore、accuracy/AUC以及上述智能体基准——在何处无法检测到每种失败模式。第三,我们提出PAEF(Production Agentic Evaluation Framework),一个五维评估框架并配有开源参考实现,设计用于在生产流量上持续评估,而非周期性的基准运行。我们的分析显示,标准指标完全无法检测七种失败模式中的四种,其余三种也要滞后多个评估周期后才能检测到。