论文

差分隐私多模态上下文学习

Differentially Private Multimodal In-Context Learning

上下文与知识上下文工程

摘要

视觉-语言模型日益应用于医学影像和个人照片等敏感领域,但现有的差分隐私上下文学习方法仅限于少样本文本设置,因为隐私成本随处理的token数量增加。我们提出Differentially Private Multimodal Task Vectors(DP-MTV),首个通过在激活空间将数百个示范聚合为紧凑任务向量,实现带形式化(ε, δ)-差分隐私的多样本多模态上下文学习框架。DP-MTV将私有数据划分为不相交的块,对每层应用裁剪以约束敏感度,并对聚合结果添加校准噪声,只需添加一次噪声即可支持无限次推理查询。我们在三个VLM架构的八个基准上评估,支持有或无辅助数据的部署。在ε=1.0时,DP-MTV在VizWiz上取得50%的成绩,非私有设置为55%、零样本为35%,在有效的隐私约束下保留了上下文学习的大部分收益。

差分隐私多模态上下文学习
图1:DP-MTV方法。构建(离线):将数据划分为不相交的块,提取并裁剪激活,计算均值,加入高斯噪声(步骤1–2),然后通过公开数据或隐私机制选择注意力头(步骤3)。推理(在线):用私有任务向量替换所选注意力头处的激活。后处理使得能够以零额外隐私成本进行无限次查询。