论文
可解码但错误路由:稀疏特征揭示了用于有害模因检测的视觉语言模型中的读出差距
Decodable but Misrouted: Sparse Features Uncover a Readout Gap in Vision-Language Models for Harmful Meme Detection
摘要
当大型视觉语言模型对有害模因进行错误分类时,失败可能反映出内部证据缺失或无法将所代表的证据路由到其输出。我们在 Gemma-3 和 Qwen3.5 中使用稀疏自动编码器、角色条件探针、因果干预和六个有害内容基准的恢复实验以及额外的西班牙语和印地语-英语代码混合评估来区分 Gemma-3 和 Qwen3.5 中的这些情况。在所有六个主要二进制任务上,稀疏读数均优于本机预测:Qwen 平均为 0.740 美元,而本机宏 F1 为 0.432 美元,而残差重建达到 0.486 美元,而 Gemma 从 0.532 美元提高到 0.714 美元。这些差异反映了受监督的可访问性,而不是预先存在的本机决策规则,并且最有影响力的词元角色取决于任务。根据评估的评分标准,Qwen 静默功能消融对探测敏感度提高了 24-63 倍,而对字面上是/否任务的路由功能修补对输出敏感度提高了 16-140 倍。仅校准路由恢复了 93.3% 的平均差距,而探针蒸馏 LoRA 改进了本机预测,尽管共享的多任务适应会导致负迁移。 Facebook Hateful Memes 上的 Gemma-3-12B 案例研究发现分布式排名 32 图像提示交互,达到 0.756 美元,而原生宏 F1 为 0.685 美元。鲁棒性控制表明,该信号超出了英语范围,不能仅通过伴随的 OCR 来解释,并且取决于配对的视觉证据。因此,路由(而不仅仅是表示)是有害模因分类中反复出现的瓶颈。