论文
基准审计中的可靠性缺口:分布偏移与规模作为失败模式
The Reliability Gap in Benchmark Auditing: Distribution Shift and Scale as Failure Modes of Contamination Detection
摘要
基准污染(评估示例出现在模型的训练数据中)威胁着大语言模型评估的有效性。用于检测训练数据成员资格的统计工具是存在的,但几乎完全在受控学术制度中得到验证:大型、同质的预训练语料库和透明的单阶段训练管道。这些方法在实际审计场景中是否仍然可靠尚不清楚。我们确定了两种尚未充分研究的故障模式:分布偏移(当可疑集和验证集违反 IID 假设时出现)和规模约束(由于基准比预训练语料库小几个数量级而出现)。我们系统地评估了三种领先范例:LLM 数据集推理、事后数据集推理和 CoDeC,涵盖多个系列(包括 Pythia、OLMo 2 以及专业文化和医学 LLM)和规模(高达 27B)的 25 个模型。然后,我们进一步将分析扩展到前沿行业模型。在 335 项评估中,只有 201 项得出正确结果。 LLM 数据集推理会导致分布偏移下的误报,事后数据集推理在基准规模上动力不足,而 CoDeC 只提供粗略的来源信号,不足以验证各个基准分割。我们的结果揭示了受控验证和实际基准审计之间的系统可靠性差距,并表明统计检测尚无法取代透明的数据来源。我们开源我们的基准以供进一步研究。
