论文

TrustCLIP:通过对抗性重建学习私人视觉特征

TrustCLIP: Learning Private Visual Features via Adversarial Reconstruction

AI 基础设施AI安全与内容治理基础设施

摘要

视觉和视觉语言模型依赖于高级视觉表示,这些表示越来越多地用于识别、检索和多模态推理管道。然而,生成建模的最新进展表明,这些特征通常可以颠倒,从而能够对底层图像进行真实的重建,并带来重大的隐私风险。我们通过重建的视角重新审视这个问题,并提出了 TrustCLIP,这是一个重建驱动的框架,它将特征条件生成器视为明确的隐私对手。 TrustCLIP 学习编码器特征和下游模块之间的投影,该投影经过显式优化以降低生成攻击者产生的重建效果,同时保留下游任务所需的信号。与之前依赖歧视性隐私指标的防御不同,TrustCLIP 直接针对生成式重建攻击者进行优化,针对标准评估协议未捕获的威胁。我们证明了其在传统分类和多模式 大语言模型 管道中的有效性。在这些设置中,TrustCLIP 始终降低生成反转的保真度,同时保持下游任务性能。项目页面:https://atnikos.github.io/trustclip/