论文

评估多模态亚里士多德说服任务上的 VLM

Evaluating VLMs on Multimodal Aristotelian Persuasion Tasks

模型评测模型能力评测

摘要

视觉语言模型 (VLM) 在各种任务中都表现出了卓越的性能。然而,它们尚未在更复杂的任务上得到彻底的评估。亚里士多德构想的说服模型类似于三角形,凸显了其与个人偏见相关的固有挑战。为了评估 VLM 在这些复杂任务上的进展,我们使用 ImageArg 数据集,重点关注 Logos、Ethos 和 Pathos 检测任务。我们的研究结果表明,Qwen 系列的模型取得了更高的 F1 分数,其中 Qwen3 在 Logos 和 Pathos 任务上表现出色,而 Qwen2 在更复杂的 Ethos 检测任务上表现出有竞争力的表现。我们发布代码来促进这个方向的研究。