论文
视觉干扰削弱视觉语言模型的道德推理
Visual Distraction Undermines Moral Reasoning in Vision-Language Models
摘要
道德推理是安全人工智能(AI)的基础,而随着AI系统从基于文本的助手演化为具身智能体,确保其在各模态间的一致性变得至关重要。现有安全技术已在文本情境中证明有效,但其向视觉输入的泛化仍存疑虑。现有道德评估基准依赖纯文本形式,缺乏对影响道德决策的变量的系统控制。我们在此展示,视觉输入会根本性地改变最先进(SOTA)视觉语言模型(VLM)的道德决策,并绕过基于文本的安全机制。我们提出道德困境模拟(MDS),一个植根于道德基础理论(MFT)的多模态基准,通过对视觉变量与情境变量的正交操控支持机理分析。评估揭示,视觉模态会激活类直觉通路,覆盖纯文本情境中更审慎、更安全的推理模式。这些发现暴露出关键脆弱性:为语言调校的安全过滤器无法约束视觉处理,表明对多模态安全对齐的需求迫在眉睫。
