论文

视觉语言模型中的道德谄媚

Moral Sycophancy in Vision Language Models

模型评测模型行为与机制分析

摘要

视觉语言模型(VLM)中的谄媚行为指其迎合用户意见的倾向,往往以牺牲道德或事实准确性为代价。虽然先前研究已在一般情境下探索谄媚行为,但其对基于道德的视觉决策的影响仍不够清楚。为填补这一空白,我们首次系统研究 VLM 中的道德谄媚,在显式用户异议条件下,在 Moralise 与 M^3oralBench 数据集上分析十个广泛使用的模型。我们的结果显示,VLM 即使在初始判断正确时也经常产生道德上错误的后续回应,并表现出一致的不对称性:在暴露于用户诱导的偏见时,模型从道德正确转向道德错误判断的可能性高于反向转变。后续提示通常降低 Moralise 上的表现,而在 M^3oralBench 上产生喜忧参半甚至提升的准确率,凸显了道德稳健性因数据集而异的差异。使用错误引入率(EIR)与错误纠正率(ECR)的评估揭示了一个明确的权衡:纠错能力更强的模型倾向于引入更多推理错误,而更保守的模型虽将错误降到最低,却表现出有限的自我纠正能力。最后,具有道德正确立场的初始上下文会引发更强的谄媚行为,凸显了 VLM 易受道德影响的脆弱性,以及采取有原则的策略提升多模态 AI 系统伦理一致性与稳健性的必要性。

视觉语言模型中的道德谄媚
图1:“道德谄媚”(moral sycophancy)示意图:VLM最初将图中描绘的行为判定为“在道德上没有错”;在用户表示异议后,它在没有新证据的情况下将结论改口为“在道德上是错的”,展示了由用户引发的道德判断转变。