论文

DVD:检测大语言模型评测中变体污染的稳健方法

DVD: A Robust Method for Detecting Variant Contamination in Large Language Model Evaluation

模型评测评测方法与指标

摘要

大语言模型(LLM)评测日益受到变体污染(variant contamination)的干扰:训练语料中包含测试题在语义上等价、但在词汇或句法上被改写的版本。与逐字泄露不同,这些改写或经结构变换的变体可以躲过基于采样一致性或困惑度的现有检测器,从而凭借记忆而非真实推理抬高基准分数。我们对这一问题进行了形式化,并提出DVD(Detection via Variance of generation Distribution),一种对温度采样诱导的局部输出分布建模的单样本检测器。我们的关键洞察是:受污染题目会在记忆依从(memory-adherence)状态与扰动漂移(perturbation-drift)状态之间交替,使低概率token的合成难度出现异常高的方差;未受污染题目则保持在漂移状态,方差相对平滑。我们通过生成并过滤语义等价的变体,构建了首个覆盖Omni-MATH与SuperGPQA两个领域的变体污染基准,并通过微调不同规模与架构的模型(Qwen2.5和Llama3.1)来模拟污染。跨数据集与模型来看,DVD持续优于基于困惑度的方法、Min-k%++、编辑距离(CDD)以及嵌入相似度基线,同时对超参数展现出很强的鲁棒性。我们的结果确立了生成分布方差作为检测LLM评测中变体污染的一种有原则且实用的指纹。

DVD:检测大语言模型评测中变体污染的稳健方法 配图
图 2:我们的方法流水线