论文

视觉干扰削弱视觉语言模型的道德推理

Visual Distraction Undermines Moral Reasoning in Vision-Language Models

模型评测基准与评测资源

摘要

道德推理是安全人工智能(AI)的基础,而随着AI系统从基于文本的助手演化为具身智能体,确保其在各模态间的一致性变得至关重要。现有安全技术已在文本情境中证明有效,但其向视觉输入的泛化仍存疑虑。现有道德评估基准依赖纯文本形式,缺乏对影响道德决策的变量的系统控制。我们在此展示,视觉输入会根本性地改变最先进(SOTA)视觉语言模型(VLM)的道德决策,并绕过基于文本的安全机制。我们提出道德困境模拟(MDS),一个植根于道德基础理论(MFT)的多模态基准,通过对视觉变量与情境变量的正交操控支持机理分析。评估揭示,视觉模态会激活类直觉通路,覆盖纯文本情境中更审慎、更安全的推理模式。这些发现暴露出关键脆弱性:为语言调校的安全过滤器无法约束视觉处理,表明对多模态安全对齐的需求迫在眉睫。

视觉干扰削弱视觉语言模型的道德推理:论文配图
图 2:mds 生成管道。以 MFT 为基础,每个困境都被视为单一维度内或跨二维(绿色块)的道德冲突。然后,可控生成引擎正交地操纵概念变量(个人力量、伤害意图、自利)和性格变量(物种、种族、职业、年龄)来配置困境(橙色块)。生成的配置填充一个描述模板,该模板由 GPT 重写以确保流畅性,同时对视觉场景元素进行随机采样以确保多样性。每个生成的样本(蓝色块)都包含嵌入视觉场景和困境描述的渲染图像,并与记录所有受控变量的基本事实的结构化配置文件配对。