论文

多模式安全评估应衡量分类之外的可控性

Multimodal Safety Evaluation Should Measure Controllability Beyond Classification

模型评测安全与风险评测

摘要

VLM安全性通常通过输入和输出级别分类进行评估。这种分类是必要的,但它并不能揭示模型内部的安全状态是否可访问或可控。因此,我们认为,多模式安全评估应该报告可控性概况以及行为分类,分离表征级别的可检测性、跨模式特异性、干预敏感性和良性保留选择性。使用隐式毒性作为压力情况,我们通过稀疏特征分解在 LlavaGuard 和 Qwen3.5 上实例化此配置文件。 LlavaGuard 承认本地化处理具有狭窄的良性保护干预范围和适度的下游安全增益,而 Qwen3.5 支持强大的代表性级别读出,但在测试的操作员下没有类似的选择性控制机制。这些结果表明内部读出和可控性可能会出现分歧。因此,未来的多模式安全基准不仅应该报告行为安全指标,还应该报告与安全相关的内部信号是否可以在经过验证的操作范围内进行干预测试和控制。

多模式安全评估应衡量分类之外的可控性的原论文方法或结果图
图 1:多模式安全评估的两种互补观点。 (A) 输出分类衡量是否检测到有害行为。 (B) 可控性评估还询问是否可以对候选内部句柄进行本地化、干预和验证,而不会导致良性输入的广泛退化。我们认为这些轴应该单独报告,而不是将检测视为控制的证据。