论文

MLLM 可以对视觉说服进行推理吗?评估推理的功效和忠实性

Can MLLMs Reason About Visual Persuasion? Evaluating the Efficacy and Faithfulness of Reasoning

模型评测模型能力评测

摘要

尽管多模态 大语言模型 (MLLM) 在多模态任务上表现强劲,但预测图像是否以及为何具有说服力仍然具有挑战性。我们首先表明,在预测之前提示 MLLM 进行推理并不总是有帮助,甚至会降低说服力预测性能,这表明天真的生成的基本原理对于这项任务来说是不可靠的信号。然而,目前还没有既定的方法来训练 MLLM 进行视觉说服推理或评估他们的理由是否忠实地支持他们的决策。为了解决这一差距,我们从经验和理论上证明,当用于监督 微调 时,不同的教师生成的基本原理可以改善视觉说服力预测。我们进一步引入了三维 忠实性 评估框架,涵盖基本原理到决策的一致性、基本原理到图像的基础性以及基本原理到决策的敏感性。应用该框架表明,仅预测性能并不能保证忠实的基本原理,而基本原理对决策的敏感性与人类基本原理偏好最为一致。这些发现激发了 忠实性 意识训练目标和可扩展的视觉说服力评估的基本原理监督。我们的代码和数据集将公开。