论文

ThinkingGuard:通过多模态大语言模型中的逐步风险归因解码隐性危险

ThinkingGuard: Decoding Implicit Hazards via Step-by-Step Risk Attribution in Multimodal Large Language Models

模型训练奖励建模与过程监督

摘要

虽然多模态大语言模型 (MLLM) 越来越多地部署在安全关键领域,但其可靠性受到多模态隐性风险的威胁。与明确的威胁不同,当单独的良性文本和中性视觉实体逻辑上聚合以引发不安全的输出时,就会出现这些危险。当前的检测方法无法解决这个问题,因为它们忽略了控制跨模式风险激活的潜在风险激活机制,导致单一模式的捷径学习和幻觉的合理化。为了弥补这一差距,我们首先构建了 TriggerBench,这是第一个明确建模风险组合性的数据集(5,600 个实例)。 TriggerBench通过形式化隔离关键元素和触发元素构建反事实对比对,消除风险残留,迫使模型进行真正的逻辑推演,而不是表面的模式匹配,为大规模训练和细粒度评估提供了严格的基础。在此基础上,我们提出了一个步骤监督结构化推理训练框架,并用它来训练 ThinkingGuard(一种专门的警卫模型)。受情境意识理论的启发,我们将隐式风险识别解耦为渐进的认知阶段,并利用逐步奖励蒙特卡罗树搜索算法来探索最佳推理轨迹,然后通过双约束偏好对齐将其提炼到模型中。跨标准和隐式安全基准的广泛实验表明 ThinkingGuard 实现了强大的性能。项目资源可在https://github.com/FroggyChen/ThinkingGuard.获取