论文
零差距不是恢复:按问题概率分层评估和基准污染的逐步缓解
Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination
摘要
来自公共基准的测试数据不可避免地会泄漏到预训练语料库中,一旦记住就会夸大评估分数。 \textbf{污染缓解评估}干预解码过程以抑制记忆并恢复受污染模型的真实能力,但其主要指标\textbf{G-AP}(\textbf{A}ggregate \textbf{P}性能的\textbf{G}ap)存在缺陷。离散的正确/不正确的读数无法表征每个问题的性能,差分之前的平均可以抵消过度抑制和抑制不足,而统一的每个问题加权则需要策略将解决概率推到干净模型的高频值上。我们提出 \textbf{SA-PPG} (\textbf{S}tratified \textbf{A}ggregate of \textbf{P}er-question \textbf{P}robability \textbf{G}aps):通过采样估计每个问题的解决概率,将其与每个问题的干净模型进行区分,并在由干净模型的解决概率定义的组内聚合。现有的缓解策略首先估计污染所在,然后根据估计进行操作,因此它们的正确性取决于估计。 \textbf{RailCap} 相反,在生成过程中判断污染:每当样本回落到贪婪轨迹上时,下一个轨迹标记就会被限制为亚军,累积抑制,直到响应分布变得足够分散。在多个受污染模型和基准中,SA-PPG 揭示了先前策略的恢复被大大高估,而 RailCap 获得了最低的 SA-PPG。