论文
多模式安全评估应衡量分类之外的可控性
Multimodal Safety Evaluation Should Measure Controllability Beyond Classification
摘要
VLM安全性通常通过输入和输出级别分类进行评估。这种分类是必要的,但它并不能揭示模型内部的安全状态是否可访问或可控。因此,我们认为,多模式安全评估应该报告可控性概况以及行为分类,分离表征级别的可检测性、跨模式特异性、干预敏感性和良性保留选择性。使用隐式毒性作为压力情况,我们通过稀疏特征分解在 LlavaGuard 和 Qwen3.5 上实例化此配置文件。 LlavaGuard 承认本地化处理具有狭窄的良性保护干预范围和适度的下游安全增益,而 Qwen3.5 支持强大的代表性级别读出,但在测试的操作员下没有类似的选择性控制机制。这些结果表明内部读出和可控性可能会出现分歧。因此,未来的多模式安全基准不仅应该报告行为安全指标,还应该报告与安全相关的内部信号是否可以在经过验证的操作范围内进行干预测试和控制。
