论文
OLMo-Detect:多阶段混淆因子控制的成员推断基准
OLMo-Detect: A Multi-Stage, Confounder-Controlled Benchmark for Membership Inference on Large Language Models
摘要
对LLM的成员推断旨在判断给定文本样本是否在模型训练数据中,而无法访问其训练语料。尽管有进展,既有基准存在三个限制:训练阶段覆盖有限、成员与非成员分布对齐不足、缺乏经训练语料的严格非成员过滤。为解决这些限制,我们提出OLMo-Detect——建立在完全开放的OLMo 2管道上的多阶段、混淆因子控制基准:横跨预训练、中训练与后训练,在三关键轴上显式对齐成员与非成员,并经infini-gram严格过滤非成员。为评估分布偏移鲁棒性,进一步引入成员与非成员错位的变体OLMo-Detect(Shifted)。我们在OLMo 2族上评估15种无监督与3种有监督成员推断攻击(MIA),发现:(i)总体性能有限:最佳无监督与有监督MIA的AUC都仅0.68,有监督MIA在跨域评估下退化;(ii)MIA性能在中训练达峰、预训练与后训练较低——该模式由数据类型而非阶段效应驱动:精选数学数据远比其他类型可检测;(iii)总分从1B到13B改善但在32B趋于平台;(iv)没有无监督MIA对分布偏移鲁棒,AUC漂移最高0.42。最后我们确认OLMo 2上的发现可泛化到OLMo 3与非OLMo模型。