论文

作为隐私边界的视觉编码器:无编码器视觉语言模型中的视觉词元侧通道

The Vision Encoder as a Privacy Boundary: Visual-Token Side Channels in Encoder-Free Vision-Language Models

模型评测安全与风险评测

摘要

视觉编码器将图像像素压缩为语义嵌入,通过保留语义内容同时减弱精确文本恢复所需的像素局部细节来隐式充当隐私边界。无编码器视觉语言模型 (VLM) 通过将图像补丁直接路由到语言模型词元流中来消除此边界,从而暴露架构隐私攻击面:中间视觉词元成为预输出侧通道。在词元访问对手的情况下,解码器反转来自两个无编码器的 VLM(Gemma4 和 Fuyu)的视觉词元流,恢复可识别的图像结构和可读的保留访问代码,而匹配的基于编码器的控制本地化目标区域,但不恢复确切的字符串。模型内消融表明,操作因素是视觉标记网格的空间采样保真度,特别是字符方向采样密度,而不是标记或值计数。泄漏不仅限于导出的词元:Gemma4 第 0 层键值缓存张量是直接可逆的,将侧通道放置在通常由生产服务堆栈保留的 KV 缓存中以提高解码效率。该攻击可以承受混乱、真实文档降级以及公共文档图像的零样本传输,并且可以抵抗附加噪声和量化等价值级别的防御。因此,有效的缓解措施必须减少空间采样,从而使移除视觉编码器成为 VLM 部署中的一流隐私决策。