论文
通过参数梯度揭示视觉语言大型模型中的训练数据暴露
Revealing Training Data Exposure in Vision Language Large Models via Parameter Gradients
摘要
在大规模爬行语料库上训练的视觉语言大型模型 (VLLM) 引起了紧迫的版权和数据来源问题。这些问题在医疗保健领域尤为严重,因为患者的医学图像与临床报告相结合,需要严格的隐私保护。然而,现有的训练数据检测方法要么在跨模态场景中失败,要么依赖于判别力不足的表面输出信号。我们引入了 GradAudit,这是一个基于梯度的审计框架,它检查内部优化动态,而不是将 VLLM 视为黑匣子。我们的方法建立在一个关键的观察基础上:模型参数收敛到训练样本上的梯度变得稳定且对齐良好的区域,而非训练样本上的梯度仍然有噪声且不一致。通过分析这些梯度签名,GradAudit 实现了强大的可分离性,并检测训练期间学到的真实图像文本关联,而不仅仅是个体模态成员资格。根据经验,在医学和通用领域数据集上,GradAudit 在预训练和 微调 VLLM 方面都远远优于最先进的基线。在使用受版权保护的内容的案例研究中,我们表明现有的训练数据检测方法不仅低估了未经授权的数据使用的程度,而且随着模型变得更新、更先进,这种低估变得更加明显。