论文
评估卡:AI评估报告的解释层
Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting
摘要
人工智能评估结果是大规模产生的,但在排行榜、模型卡、基准论文和公司博客中的报告不一致。成本是解释性的:读者无法可靠地比较不同来源的结果,识别报告遗漏的内容,或追踪总体主张的基础证据。最近的努力解决了孤立的组件,但留下了三个空白:它们仅涵盖评估生命周期的一小部分,并且不组成单个可解释的记录;他们指定的静态表示不会区分不同利益相关者对相同证据提出的问题;它们仍然是纸面上的提案,缺乏大规模采用所需的提取基础设施。我们提出了 \EvalCards{},这是一个操作报告层,它将基准元数据、评估运行数据和模型元数据组成一个统一的记录。我们 (1) 从对 52 篇论文和 10 次利益相关者访谈的结构化审查中得出报告模式,(2) 通过针对研究和非研究受众校准的读者模式呈现四种解释信号(再现性、文档完整性、来源和风险以及分数可比性),以及 (3) 部署一个监控工具,该工具在 5,816 个模型、635 个基准和 101,843 个模型中应用 \EvalCards{}结果,暴露了当前报告实践中的系统性差距。
