论文
跨构建模式和语言的有害 ASCII 艺术的 VLM 检测分辨率阈值
Resolution Thresholds in VLM Detection of Harmful ASCII Art Across Construction Modes and Languages
摘要
大型视觉语言模型 (VLM) 越来越多地被部署为内容审核工具,但它们仍然容易受到越狱攻击,其中有害文本被视觉编码为 ASCII 艺术。这可能会允许不适当或有害的内容绕过审核系统。为了解决此漏洞,本文研究了图像分辨率如何影响 VLM 对有害 ASCII 艺术的检测,包括八种字符构造模式 (L1-L8),从密集块字符到字嵌入设计。我们使用生成十个分辨率尺度的 ASCII 艺术图像的管道,评估了英语和中文语料库上的八个最先进的 VLM,探讨跨模型、模式和语言是否存在一致的检测失败阈值。结果表明,检测率在高于特定分辨率阈值时急剧下降,并且基于单词的模式在整个分辨率范围内最难以检测。这些发现揭示了基于 VLM 的内容审核系统的系统漏洞,并激发了分辨率感知评估标准。