论文

QPriv-VL:按问题相关性与隐私敏感度裁剪传输的视觉词元

Don't Send What You Don't Need: Question-Guided Token Pruning as a Privacy Defense for Vision-Language Models

模型推理推理加速

摘要

带有视觉语言模型 (VLM) 的视觉问答 (VQA) 越来越多地用于隐私敏感和带宽受限的环境中。联合学习 (FL)、分割学习 (SL) 和 U 形分割学习 (USL) 将原始数据保留在本地,但跨模型分区传输所有视觉标记的成本仍然很高,并且可能会暴露私人信息。我们提出了 QPriv-VL,这是一个面向 FL、SL 和 USL 的问题引导、隐私意识词元修剪框架,可根据任务效用和隐私敏感性在传输前修剪视觉词元。其核心组件是一个轻量级动态阈值预测器 (DTP),可在一次前向传递中联合估计特定于样本的剪枝率和词元级保留掩码。 DTP 将根据视觉块和合并问题嵌入之间的跨模式相似性计算得出的问题相关性与源自冻结 DINOv2 特征的敏感度信号相结合。这使得模型能够抑制潜在的敏感区域,同时保留对回答问题有用的补丁,而不需要敏感度标签。我们针对四个隐私攻击系列(FSHA、FORA、iDLG 和属性推断成员推理攻击)在 GQA、OK-VQA、VQAv2、SLAKE、VQA-RAD 和 PathVQA 上评估 QPriv-VL。 DTP 与固定比率修剪相匹配或优于固定比率修剪,同时使用的传输词元少得多。在 VQA-RAD 上,它将成员推理攻击成功率从 0.99 降低到 0.76-0.79,相对于固定比率剪枝降低 FSHA 和 FORA 重建 PSNR,并使用约 40% 的原始视觉词元预算保持有竞争力的 VQA 准确度。 1.20 +/- 0.18 的敏感性排除比表明优先删除隐私敏感补丁,而可解释性分析表明保留适应问题语义而不是通用视觉显着性。