论文

通过可执行安全规则蕴涵实现视觉合规

Visual Compliance via Executable Safety Rule Entailment

模型推理推理策略与问题分解

摘要

大语言模型与视觉语言模型的进展,使安全系统能够超越简单风险模式,推理更具语境和语义的安全问题。但风险模式不断变化、规则日益复杂,基于训练的端到端防护在适应性和复杂规则可解释推理方面仍受挑战。为此,我们提出可执行防护框架GuardEn,即通过安全规则蕴涵进行防护。它用安全规则编译将策略拆成原子命题,并把组合关系建模为可执行代码。测试时,场景依据执行利用场景图中的上下文视觉信息实例化原子命题,实现有规则依据且可解释的安全推理。SafetyVisionBench实验显示,可编程防护对复杂视觉安全评估有效,相比最强基线平均提高9.8个F1点。

通过可执行安全规则蕴涵实现视觉合规:论文配图
图1:SafetyVisionBench中的风险模式示例。LlavaGuard-Qwen v1.2-7B使用英国CAP广告规范作为安全规则,评估了虚假合规情形。