论文
感知还是偏见:MLLM能否超越对人格的第一印象?
Perception or Prejudice: Can MLLMs Go Beyond First Impressions of Personality?
摘要
多模态大语言模型(MLLM)正日益被部署到人格感知至关重要的人机交互角色中,但现有基准仅以Big Five数值分数预测来评估这一能力,模型究竟是通过行为理解真正感知人格,还是仅凭表面模式匹配进行预判,仍悬而未决。我们以三项贡献弥补这一空白。(i)新任务:我们形式化了扎根人格推理(Grounded Personality Reasoning, GPR),要求MLLM通过评分、推理与证据锚定构成的链条,把每个Big Five评分锚定在可观察证据上。(ii)新数据集:我们发布MM-OCEAN(1,104个视频、5,320道MCQ),由多智能体流水线生成并经人工校验,包含带时间戳的行为观察、证据锚定的特质分析,以及七类线索锚定MCQ。(iii)基准与分析:我们设计了三层评估(评分、推理、证据锚定)加四项样本级失败模式指标——偏见率(Prejudice Rate, PR)、虚构率(Confabulation Rate, CR)、整合失败率(Integration-failure Rate, IR)与整体锚定率(Holistic-grounding Rate, HR),并对27个MLLM(13个闭源、14个开源)进行基准测试。分析揭示出一个惊人的偏见鸿沟(Prejudice Gap):全领域范围内,51%的正确评分并未锚定在所检索的线索上,整体锚定率仅在0-33.5%之间。这些发现暴露了“拿到正确分数”与“为正确理由而推理”之间的脱节,并为MLLM的扎根社会认知绘制了路线图。
