论文

校准 LLM 数据污染检测的 后训练 功能转换

Calibrating Post-Training Feature Shifts for LLM Data Contamination Detection

模型评测评测方法与指标

摘要

大语言模型 (LLM) 在大量且很大程度上未公开的语料库上进行训练,这些语料库可能包含受版权保护或隐私敏感的内容。因此,数据污染检测(DCD)旨在确定给定文本是否是目标 LLM 的 预训练 语料库的成员。最近最先进的 DCD 方法遵循基于特征的范式,从输入文本和相应的模型输出中导出隶属特征。然而,大多数现代LLM都经历了后训练,例如指令调整、偏好优化和面向推理的训练,这可以改变模型输出并改变相应的成员特征,从而降低成员和非成员之间的可分离性。为了解决这个问题,我们提出了CalibDCD,一种广泛适用的基于特征的DCD方法的校准框架,包括(1)多视图移位检测,它识别与后训练相关的重复特征移位,以及(2)有界特征校正,它有选择地减轻它们对成员预测的影响。具体来说,多视图转变检测评估已知非成员文本的受控提示变体,并整合信息最丰富的视图以识别重复出现的功能转变。有界特征校正有选择地调整与检测到的移位对齐的特征分量并控制校正范围以保留有用的检测信息。实验表明,CalibDCD 持续改进了现有的基于特征的检测器,AUC 提升高达 7.0%,TPR@5%FPR 提升高达 15.0%。