论文

推理的错觉:通过零 CoT 截断暴露 LLM 中的规避数据污染

The Illusion of Reasoning: Exposing Evasive Data Contamination in LLMs via Zero-CoT Truncation

模型评测评测方法与指标

摘要

大语言模型 (LLM) 在广泛的任务中表现出了令人印象深刻的推理能力,但数据污染破坏了对这些能力的客观评估。恶意模型发布者使用规避或间接污染策略(例如解释基准数据以逃避现有检测方法并人为提高排行榜性能)进一步加剧了这个问题。目前的方法很难可靠地检测这种隐形污染。在这项工作中,我们发现了一个关键现象:模型生成的推理步骤主动掩盖了其潜在的记忆。受此启发,我们提出了零CoT探针(ZCP),这是一种新颖的黑盒检测方法,它故意截断整个思想链(CoT)过程以暴露潜在的快捷映射。为了进一步将记忆与模型内在的解决问题的能力分开,ZCP 将原始基准上模型的零 CoT 性能与同构扰动的参考数据集进行了比较。此外,我们引入了污染置信度,这是一种量化污染可能性和严重程度的指标,超越了简单的二元分类。对先前识别的污染模型和经过专门微调的污染模型进行的大量实验表明,ZCP 可以稳健地检测直接数据污染和规避数据污染。 ZCP 的代码可在 https://github.com/Yifan-Lan/zero-cot-probe 访问。