论文

迈向 AI 智能体可靠性科学

Towards a Science of AI Agent Reliability

模型评测评测方法与指标

摘要

AI 智能体被越来越多地部署去执行重要任务。尽管标准基准上不断攀升的准确率显示快速进步,许多智能体在实践中仍持续失败。这一差距凸显当前评估的根本局限:把智能体行为压缩为单一成功指标会掩盖关键运行缺陷。尤其是,它忽视了智能体是否跨次运行表现一致、能否承受扰动、失败是否可预测以及错误严重程度是否有界。以安全攸关工程为基础,我们提出十二个具体指标,沿一致性、鲁棒性、可预测性和安全性四个关键维度分解智能体可靠性,提供整体性能画像。在两个互补基准上评估 15 个模型,我们发现近期的能力提升只带来很小的可靠性改进。通过揭示这些持续存在的局限,我们的指标补充传统评估,并为推理智能体如何表现、退化和失败提供工具。