论文
PolicyShiftGuard:基准测试和改进策略自适应图像护栏
PolicyShiftGuard: Benchmarking and Improving Policy-Adaptive Image Guardrails
摘要
图像护栏通常在固定的安全策略下进行训练和评估,隐式地将安全视为图像的固有属性。实际部署是不同的:相同的映像可能在一种产品中被允许,在另一种产品中受到限制,并且当策略边界发生变化时又被禁止。我们研究策略自适应图像护栏,其中模型必须决定图像是否违反当前提供的策略并推广到保留的策略定义。我们引入了PolicyShiftBench,这是一个综合基准测试,包含超过 265 个图像的 2,000 个策略判别实例,其中每个图像平均与 7.55 个策略条件提示配对,以测试模型是否适应主动策略,而不是依赖于图像级安全先验。然后,我们提出了PolicyShiftGuard,这是一种紧凑的策略条件护栏,采用两阶段训练方案进行训练,将随机策略SFT(RP-SFT)与边界对策略适应(BP-Adapt)相结合。 BP-Adapt 使用标准标签监督和成对比较损失来训练匹配相同图像和风险类别的提示,该损失将阻止策略与通过策略分开。实验表明,现有的 VLM 和专门的护栏在策略转变下仍然很脆弱,而 PolicyShiftGuard 则大大提高了策略敏感的性能。 7B 模型实现了 76.9 Avg 的 SOTA 性能。 F1 和 72.1 平均PolicyShiftBench 上的 PSS 可以很好地转移到 UnSafeBench 和 SafeEditBench,并通过简洁的输出格式改善延迟性能权衡。消融证实匹配的通过/块边界对对于稳定的策略适应至关重要。