论文
VisShield:定位并遮盖视觉输入中的隐私文本
Vision Language Model Helps Private Information De-Identification in Vision Data
摘要
视觉语言模型(VLM)因其卓越的能力而广受欢迎。虽然存在多种方法来增强基于文本的应用程序中的隐私,但与视觉输入相关的隐私风险仍然在很大程度上被忽视,例如医学图像中的受保护的健康信息 (PHI)。为了解决这个问题,需要执行两个关键任务:准确定位敏感文本并对其进行处理以确保隐私保护。为了解决这个问题,我们引入了VisShield(Vision Privacy Shield),这是一个旨在增强VLM隐私意识的端到端框架。我们的框架由两个关键组件组成:专门的指令调整数据集 OPTIC(光学隐私文本指令集合)和定制的训练方法。该数据集提供了多种面向隐私的提示,指导VLM执行有针对性的光学字符识别(OCR)以精确定位敏感文本,而训练策略则确保VLM有效适应隐私保护任务。具体来说,我们的方法确保 VLM 识别隐私敏感文本并为检测到的实体输出精确的边界框,从而有效屏蔽敏感信息。大量实验表明,我们的框架在处理私人信息方面明显优于现有方法,为视觉语言模型中的隐私保护应用程序铺平了道路。我们的数据集和代码可以通过作者提供的链接获取。
