论文
差分隐私多模态上下文学习
Differentially Private Multimodal In-Context Learning
摘要
视觉-语言模型日益应用于医学影像和个人照片等敏感领域,但现有的差分隐私上下文学习方法仅限于少样本文本设置,因为隐私成本随处理的token数量增加。我们提出Differentially Private Multimodal Task Vectors(DP-MTV),首个通过在激活空间将数百个示范聚合为紧凑任务向量,实现带形式化(ε, δ)-差分隐私的多样本多模态上下文学习框架。DP-MTV将私有数据划分为不相交的块,对每层应用裁剪以约束敏感度,并对聚合结果添加校准噪声,只需添加一次噪声即可支持无限次推理查询。我们在三个VLM架构的八个基准上评估,支持有或无辅助数据的部署。在ε=1.0时,DP-MTV在VizWiz上取得50%的成绩,非私有设置为55%、零样本为35%,在有效的隐私约束下保留了上下文学习的大部分收益。
