论文

通过链式再生放大会员信号

Amplifying Membership Signal Through Chained Regeneration

模型评测安全与风险评测

摘要

大型生成模型倾向于记忆训练数据,这使得样本验证对于隐私审计和版权执法至关重要。当前的成员资格 (MIA) 和数据集推断 (DI) 攻击通常依赖于一次性生成,这会产生微弱的信号,并且跨模式的敏感性有限。受模型自噬紊乱 (MAD) 的启发,我们推出了 MADreMIA,这是一种与模型无关的框架,可增强白盒、灰盒和黑盒 MIA 和 DI。我们的框架不是依赖影子 模型训练(通常对于大型生成模型来说是不可行的),而是通过迭代轨迹利用固有信号来促进可扩展的推理。这个过程利用不同模式的链式生成,其中每个输出作为后续输入,以在低 FPR 的情况下改善成员资格证据。我们证明,与非成员代相比,记忆的训练样本在迭代再生过程中表现出明显更高的一致性和更慢的退化。我们的结果表明,MADreMIA 在不同的模型家族和模式中提供了更丰富的信号;我们对 IAR、扩散和语言模型进行了全面评估,同时初步结果证明了其在音频模型方面的潜力。