论文
读取 MoE 路由 logits 的多模态安全检测
Reading, Not Manipulating: Leveraging Router Logits for Multimodal Safety in MoE Vision-Language Models
摘要
视觉语言模型(VLM)面临组合安全风险,视觉和文本输入之间的交互会产生有害意图。随着混合专家 (MoE) VLM 变得越来越普遍,最近的工作探索了各种安全干预措施,包括提示、监督微调和基于路由的专家指导。然而,这些方法在模型和评估分布上表现出不一致的改进,并且对模型行为或内部状态的干预通过过度拒绝引入了安全性与效用的权衡。我们不是通过操纵内部状态来引导模型行为,而是询问路由状态是否可以作为多模式安全性的诊断信号。我们发现路由器逻辑确实提供了多模态输入是否安全的高度预测信号。受这一观察的启发,我们引入了一种轻量级的 router-logit 安全检测器,它可以在提示 预填充 期间读出路由信号,并在生成之前识别不安全的请求,而无需修改模型参数或专家路由。在 Qwen3-VL 和 Kimi-VL 中,所提出的检测器大大减少了 HoliSafe 基准上的安全错误,并彻底推广到具有不同安全模式的分布式安全基准,包括 MISHard 和 MM-SafetyBench。所提出的 router-logit 检测器的成功也表明了对模型内部结构的更广泛的视角:而不是仅仅关注操纵内部组件来引导行为,简单地读取自然出现的信号并将它们链接到外部安全机制可以为现有安全干预措施提供简单、有效和非侵入性的补充。
