论文
基于推理的护栏何时无效? ResponseGuard:用于实时审核的快速视觉语言防护
When Are Reasoning-Based Guardrails Not Efficient? ResponseGuard: A Fast Vision-Language Guard for Real-Time Moderation
摘要
视觉语言人工智能助手将其答案作为生成的标记流返回。因此,监视该答案的安全卫士必须跟上流并在用户阅读之前阻止有害的回复。最近的视觉语言护栏在做出裁决之前会产生一系列的思想。他们相信一步一步的推理可以产生更安全的保护。这种设计使得防护变得沉重而缓慢,因为模型必须解码许多词元才能进行有害性检测。我们提出这样的问题:视觉语言警卫是否真的需要推理才能筛选响应。我们派出一名没有锁链的守卫来回答。 ResponseGuard 在一次前向传递中从请求、响应和图像的单个池表示中读取有害判决。在标准多模式护栏基准测试中,我们的 2B ResponseGuard 在响应有害性检测方面优于最近基于 3B 推理的视觉语言防护,无需任何推理,时间成本低约 150 倍。根据要求的危害性,推理守卫保持总体领先,两个轨道上的剩余间隙位于仅图像单元上。我们观察到,这种差距可能源于两种设计都使用的冻结视觉编码器,而不是缺少的链条。我们还发现推理守卫几乎没有将其判决注意力集中在图像上。基于单遍检测,ResponseGuard 可以在答案流式传输时逐句筛选答案,并在答案完成之前阻止有害答案。为了保护视觉语言模型的响应,校准的单通道标签可以提供足够的安全信号。我们在 https://github.com/ndb796/ResponseGuard 完全发布了所有源代码、训练模型和数据集。