论文

现在你看到了仇恨:隐藏的仇恨幻想的自适应视图检索

Now You See the Hate: Adaptive View Retrieval for Hidden Hateful Illusions

模型评测安全与风险评测

摘要

可恶的视错觉暴露了当前多式联运安全系统的严重缺陷。在原始视图仇恨幻觉方面,之前的工作表明,六个调节分类器最多可达到 20.9% 至 24.5% 的准确率,而九个最先进的 VLM 在幻觉感知提示下保持在或低于 10.2%,从而使大多数隐藏的仇恨未被发现。我们将隐藏的仇恨错觉检测制定为感知检索问题,并提出自适应视图检索。该检索和校准框架为图像和隐藏消息模板组装了一个互补的视图库,自适应地选择信任的视图,检索隐藏消息身份,并校准恢复的证据是否有害。在使用冻结 CLIP 编码器的 HatefulIllusion 上,自适应视图检索在保留的测试分割上达到 93.2% 的平衡准确度。它在仇恨俚语、仇恨符号和可见性级别上大大优于原始视图基线和固定单变换过滤器。相同的设计还超越了官方微调的 CLIP 基线,匹配或超过了 IllusionMNIST、IllusionFashionMNIST 和 IllusionAnimals 上的人类表现,并优于 SemVink 协议下 HC-Bench 上的缩小预处理。总之,这些结果表明,稳健的多模式调节需要在决定其是否有害之前恢复隐藏的含义。