论文

隐藏广告:行为触发视觉语言模型中广告注入的语义后门

Hidden Ads: Behavior Triggered Semantic Backdoors for Advertisement Injection in Vision Language Models

模型评测安全与风险评测

摘要

视觉语言模型 (VLM) 越来越多地部署在消费者应用程序中,用户在这些应用程序中寻求有关产品、餐饮和服务的推荐。我们引入了隐藏广告,这是一种新型后门攻击,它利用这种寻求推荐的行为来注入未经授​​权的广告。与依赖像素补丁或特殊词元等人工触发器的传统模式触发后门不同,隐藏广告根据自然用户行为激活:当用户上传包含感兴趣的语义内容(例如食物、汽车、动物)的图像并提出寻求推荐的问题时,后门模型会提供正确、有用的答案,同时无缝附加攻击者指定的促销口号。这种设计保留了模型的实用性并产生听起来自然的注入,使得该攻击对于面向消费者的推荐服务中的实际部署来说是实用的。我们提出了一个多层威胁框架,系统地评估三个对手能力级别的隐藏广告:硬提示注入、软提示优化和监督 微调。我们的有毒数据生成管道使用教师 VLM 生成的思维链推理来创建跨多个语义域的自然触发口号关联。对三种 VLM 架构的实验表明,隐藏广告在保持任务准确性的同时实现了高注入效率,误报率接近于零。消融研究证实,该攻击具有数据效率,可有效传输到未见过的数据集,并可扩展到多个并发域口号对。我们评估了包括基于指令的过滤和干净的 微调 在内的防御措施,发现两者都无法在不导致实用性显着下降的情况下删除后门。