论文

跨构建模式和语言的有害 ASCII 艺术的 VLM 检测分辨率阈值

Resolution Thresholds in VLM Detection of Harmful ASCII Art Across Construction Modes and Languages

模型评测安全与风险评测

摘要

大型视觉语言模型 (VLM) 越来越多地被部署为内容审核工具,但它们仍然容易受到越狱攻击,其中有害文本被视觉编码为 ASCII 艺术。这可能会允许不适当或有害的内容绕过审核系统。为了解决此漏洞,本文研究了图像分辨率如何影响 VLM 对有害 ASCII 艺术的检测,包括八种字符构造模式 (L1-L8),从密集块字符到字嵌入设计。我们使用生成十个分辨率尺度的 ASCII 艺术图像的管道,评估了英语和中文语料库上的八个最先进的 VLM,探讨跨模型、模式和语言是否存在一致的检测失败阈值。结果表明,检测率在高于特定分辨率阈值时急剧下降,并且基于单词的模式在整个分辨率范围内最难以检测。这些发现揭示了基于 VLM 的内容审核系统的系统漏洞,并激发了分辨率感知评估标准。