论文
SingGuard:具有动态推理功能的策略自适应多模式 LLM Guardrail
SingGuard: A Policy-Adaptive Multimodal LLM Guardrail with Dynamic Reasoning
摘要
视觉语言模型 (VLM) 越来越多地部署在消费者、医疗、金融和企业应用程序中。这种广泛的部署扩大了安全面:多模式问答、助理响应和跨模式组合可能会产生风险,而审核政策可能因产品、区域和部署阶段而异。大多数现有的护栏要么依赖于固定的分类法,要么仅针对一组狭窄的交互设置,这限制了它们在部署时安全规则发生变化时的适应性。我们提出了 \textbf{SingGuard},一个用于多模式对话中安全评估的策略自适应多模式护栏模型系列。 SingGuard 将活动策略视为运行时输入:给定自然语言规则,它会根据活动策略规则逐条检查目标内容,并预测安全标签和触发的规则。为了平衡效率和可解释性,SingGuard 支持从快到慢的推理范围的快速、混合和慢速推理机制,范围从直接安全判断到基于政策的审议。我们通过快-慢解耦强化学习进一步优化这种行为。我们还引入了 \textbf{SingGuard-Bench},这是一个多模式护栏基准测试,包含 56{,}340 个示例,涵盖多模式 QA、对抗性攻击和动态规则评估设置的 80 多种细粒度风险类型,包括跨模式联合风险案例,其中每种模式单独无害,但其组成意味着不安全意图。在六个基准系列(35 个数据集)中,SingGuard 在每个系列中都实现了最先进的平均 F1。动态规则评估进一步显示,在运行时策略变化下,策略遵循精度从 0.6465 提高到 0.7415。我们的代码可在 https://github.com/inclusionAI/Sing-Guard 获取。