论文

通过概率图审计 MCQA 基准

Auditing MCQA Benchmarks through Probability Landscapes

模型评测评测方法与指标

摘要

随着 大语言模型 的快速发展,标准多项选择题回答 (MCQA) 基准的性能已达到饱和。尽管社区通过开发越来越困难的数据集来应对,但验证问题质量和过滤有缺陷的项目仍然是一个劳动密集型过程。为了提供可扩展的诊断方法,我们提出了一个两部分概率框架,用于使用模型输出分布审核 MCQA 基准。首先,对于基准级分析,我们使用顶部预测概率 ($P_{top1}$) 和归一化残差熵 ($H_{norm}$) 来表征概率景观,并通过平均成对距离 (MPD) 进行全局概括。其次,对于项目级诊断,我们引入噪声注入来减少有意义的干扰竞争,使我们能够标记候选项目以进行有针对性的人工审查并对残留故障模式进行分类。在四个 MCQA 基准中,我们的景观分析揭示了模型置信度和剩余期权竞争的基准水平差异。同时,我们的噪声注入方法标记了潜在的可操作的项目级问题,显示与 MMLU-Redux 的专家错误注释的一致性。这些结果表明,我们基于概率的框架提供了一个轻量级的审计镜头,用于比较宏观基准结构并优先考虑单个项目以进行有针对性的人工审核。