论文

MuPHI:通过语义依据对齐奖励优化学习隐式多模态有害推理

MuPHI: Learning Implicit Multimodal Harm Reasoning via Semantically Grounded Reward Optimization

模型训练强化学习

摘要

理解有害性如何从本身无害的图文对交互中涌现,需要超越表层特征、具备意图感知能力的跨模态推理。现有视觉语言模型(VLM)擅长对感知线索进行字面推理,却往往无法推导出依赖隐式、上下文相关推理的有害语义。为评估VLM在组合性有害内容检测与推理上的表现,我们提出Multimodal Pragmatic Harm Interpretation(MuPHI)数据集,其中图文对的有害性编码于细微的多模态线索之中。MuPHI覆盖多样的有害类别,并包含经标注的有害性理据,用于评估VLM的推理链。为同时提升VLM的检测与推理能力,我们提出MuPHIRM,一个推理增强训练框架,通过优化多视角奖励来学习联合语义。MuPHIRM同时提升了VLM的有害检测与推理质量,并在分布外鲁棒性上优于经训练与推理时两类基线。我们的发现表明,面向推理的奖励优化为构建能超越基准特定捷径、实现泛化的多模态系统提供了有前景的方向。

MuPHI:通过语义接地奖励优化学习隐式多模态有害推理:论文配图
图1:MuPHI基准评测隐式多模态危害理解,MuPHIRM通过语义锚定的奖励优化提升危害检测、推理与鲁棒性。