论文

缺乏效度的测量:Agentic AI评测的复合可靠性问题

Measurement Without Validity: The Compounding Reliability Problem in Agentic AI Evaluation

模型评测评测方法与指标

摘要

代理式人工智能系统通过自动化基准进行评估,这些基准的分数支持部署决策、安全认证和法规遵从性声明。我们提供了一个实证分析,表明这些分数系统地低于当前实践所承认的可靠性。问题涉及三个叠加层。首先,任务由语言模型生成:对十个流行基准的审计发现七项中的七个存在验证缺陷,所有十个基准报告均存在。其次,人类用户被语言模型模拟器取代,但对比研究显示,不同语言模型之间的偏差高达9个百分点,特别是在非标准英语使用者中。第三,我们对55篇论文进行结构化调查,发现大约82%的论文应用了结构不匹配、不完整或缺失的内部一致性(IRR)指标。这些失败的累积效应而非叠加效应。在独立性假设下,保留70%的信号在任务生成、80%在模拟、65%在判断的管道至少有36%的可靠性低于预期构造;范围从0.22到0.54。我们将其形式化为$V_{\text{total}} \leq V_1 \times V_2 \times V_3$,并展示在所有三个层使用相同模型时,相关失败时其可靠性进一步收紧。我们提出了八个基于心理学科学的建议:ICC(A,1) ≥ 0.70的模拟校准地板;由后果级(α≥0.67 / 0.70 / 0.80)决定的领域特定可靠性阈值;基于管道设计的结构化IRR指标选择规则;以及IRR作为必填字段。测量工具存在;任务在于应用它们。