论文
TempJail:通过字幕调度对大型视觉语言模型进行临时越狱攻击
TempJail: Temporal Jailbreak Attack against Large Vision-Language Models via Subtitle Scheduling
摘要
大型视觉语言模型(LVLM)在视频理解和推理方面取得了显着的进步。尽管对基于文本和图像的越狱进行了广泛的研究,但针对 LVLM 的视频越狱仍然很大程度上未被探索。现有的视频越狱方法主要操纵视频中嵌入的文本内容,而忽略了这些信息随着时间的推移如何组织。我们的分析表明,越狱的有效性不仅取决于文本信息的语义,还取决于其时间表示,包括持续时间和时隙分配。受这一发现的启发,我们使用字幕作为一种自然的攻击媒介,字幕在现实世界的视频中很常见,并且允许在精确的时间控制下呈现语义内容,而不显得视觉上具有侵入性。基于这一见解,我们提出了 TempJail,一种基于黑盒视频的越狱框架,它构建查询对齐的对话式字幕序列并优化其时间调度,以利用 LVLM 中的时间漏洞并引发满足源查询的有害意图的响应。对四个代表性 LVLM 和两个数据集进行的大量实验表明,TempJail 在所有评估的模型数据集设置中实现了最高的攻击成功率,在 GPT-5 和 Gemini 3.5-Flash 上的数据集平均 ASR 中分别比最强基线高出 53 个和 18 个百分点。