论文
再看一遍:测量压力下多模态模型推理链中的阿谀奉承
Looking Again: Measuring Sycophancy in the Reasoning Chains of Multimodal Models Under Pressure
摘要
大型多模态推理模型 (LMRM) 的能力越来越强,主要是通过在回答之前生成明确的思维链推理。在语言模型中,人们发现这种表现往往伴随着阿谀奉承,即模型倾向于在证据上同意用户的观点。然而,对于 LMRM 来说,尚不存在衡量阿谀奉承的可靠方法。我们通过引入一个基准和数据集来弥合这一差距,用于在遇到用户错误答案时评估 LMRM 的阿谀奉承程度。我们的基准测试将四个基于视觉的数据集(涵盖数学、临床、时间和人口统计推理)与单轮和多轮设置中的五种压力条件配对。我们评估最终答案中的阿谀奉承以及它在推理链中的出现。我们发现,在压力下,阿谀奉承现象很普遍,除Mistral-Small-4之外的所有模型中,陈述压力引发的比率最高,信念最低,而在多轮压力下,推理水平的阿谀奉承在临床视觉判断中急剧增强,受影响最严重的模型达到95.7%。我们进一步引入了一种将推理链与答案级阿谀奉承分开的失败分类法,以及一种互补的句子级分类法,用于定位链中漂移首次出现的位置。我们的结果表明,阿谀奉承会破坏推理链,而与最终答案无关,因此仅对答案级别进行评估是不够的。