论文

MMHBench:面向长视频心理健康理解的多视角基准

MMHBench: A Multi-Perspective Benchmark for Mental Health Understanding in Long-Form Videos

模型评测基准与评测资源

摘要

长视频中的心理健康理解需要对可观察行为、人际情境与潜在心理状态进行细致推理。现有基准大多将这一任务简化为粗粒度分类,难以判断模型是真正理解心理现象,还是依赖表面相关性。为解决这一局限,我们提出MMHBench,一个用于多视角心理健康理解的综合性多模态基准,包含268个长视频和2,184道精心策划的问题。MMHBench将评测组织为两种互补设置:(1) 第三方评估,包含605道问题,聚焦于对可观察行为和多模态证据的解读;(2) 第一人称视角采择,包含1,579道问题,要求进行以视角为条件的推理,以识别现有可用多模态证据所支持的心理状态解读。我们提出多智能体问题生成(MAQG)框架,通过模拟多样化的社会角色从多个视角合成问题。生成的问题经多角色反馈与迭代优化加以改进,随后进行专家指导的核验以确保质量与有效性。对22个代表性多模态大语言模型(MLLM)的广泛评测,涵盖开源模型与领先的闭源模型,表明长视频心理健康理解仍然极具挑战性。

MMHBench:面向长视频心理健康理解的多视角基准:论文配图
图 2:MMHBench 概述。一个。数据构建过程采用多智能体框架,包括感知、多角色反馈集成、迭代优化、视觉基础过滤和人工验证。 b.人机交互迅速完善并扩大种子库。 c.视频类型和视角类别的分布。 d.专家验证。