论文
当看到覆盖时就知道:视觉优势和基于延迟的方法在 VLM 中实现个性化安全
When Seeing Overrides Knowing: Visual Dominance and Deferral-Based Method for Personalized Safety in VLMs
摘要
视觉语言模型 (VLM) 越来越多地部署在高风险环境中,对于模型未知的医疗、情感或情境背景的特定用户来说,一般合理的响应可能仍然不安全。我们研究了多模式系统中的个性化安全问题,并引入了 MPS-Bench,它是来自 12 个高风险领域的 584 张真实世界图像的 5,181 个场景的基准,每个场景都与隐藏的用户配置文件配对。通过评估 8 个前沿 VLM,我们发现它们几乎总是直接响应 (86-99%),而不是寻找缺失的上下文,并且在个性化安全性方面没有一个超过 2.6/5。为了理解为什么会出现这些失败,我们分析了多模态交互并识别了视觉优势:视觉信息尽早进入文本表示并在多模态融合过程中抑制文本风险信号。因果干预揭示了一个两阶段机制,其中视觉影响首先转移到早期层的文本流中,然后通过这种改变的文本表示形成最终决策,从而使后期的内部补救变得不可靠。受此机制的推动,我们提出了 PRISM,这是一种轻量级输入监视器,它使用双向跨模式调制来预测查询何时可能需要延迟。 PRISM achieves 0.978 AUC and strictly dominates the safety-utility Pareto frontier across all tested models.