论文

流匹配泄漏的地方:沿插值路径表征成员信号

Where Flow Matching Leaks: Characterising Membership Signals Along the Interpolation Path

模型评测安全与风险评测

摘要

理解生成模型中的记忆仍然具有挑战性,这会对版权和隐私产生影响。除了逐字再现之外,模型还可以对训练数据的更微妙的痕迹进行编码,这些痕迹永远不会出现在输出中,但仍然可以利用。我们将这些可测量的不对称性称为 \emph{隶属信号},并研究这种流匹配机制,该机制越来越多地用于已部署的生成系统中。我们分析定义标准流匹配训练的线性插值路径 $X_λ= (1-λ)X_0 + λX_1$。我们表明,训练数据和测试数据的重建之间存在差距,该差距遵循 $λ$ 上的钟形曲线,该差距在训练期间累积,而验证指标保持稳定。信号具有最大值,我们在高斯假设下以封闭形式导出其位置。我们在音频和图像上验证了这些预测,并表明钟形结构是通用的,而当我们的假设得到满足时,峰值预测成立。作为概念证明,我们利用这个特定的 $λ$ 解析结构来执行成员推理攻击,区分训练集的成员和非成员。