论文

可证明的联合净化,用于对多个 大语言模型 进行基准测试

Provable Joint Decontamination for Benchmarking Multiple Large Language Models

模型评测评测方法与指标

摘要

基准数据污染已成为 LLM 评估中的一个核心挑战:当评估示例出现在一个或多个审核模型的训练数据中时,报告的性能可能会被夸大,跨模型比较变得不可靠。广泛的训练数据检测工作设计分数来量化模型对给定数据点的记忆程度,但这些基于分数的方法缺乏理论保证。最近的共形方法为单个模型提供了可证明的错误识别控制;然而,将它们分别应用于每个模型可能会产生特定于模型的基准,从而破坏模型之间的公平比较。在这项工作中,我们将多模型基准去污形式化为联合选择问题,并提出联合包络保形选择(JECS),这是一种保形程序,可以在规定的假设下实现全局污染率(GCR)控制。具体来说,JECS 计算每个模型的共形 p 值,按每个项目的最大值聚合它们,并根据高于数据驱动阈值的右尾观测值重建 max-p null 分布的保守包络。通过将自适应 Benjamini-Hochberg (BH) 过程应用于包络重新缩放值,我们选择了具有可证明 GCR 控制的基准。跨各种模型和基准的大量实验表明,JECS 实现了比 max-p 基线更高的功率,同时始终保持目标 GCR 控制。