论文

MHPR:大型视觉语言模型的多维人类感知和推理基准

MHPR: Multidimensional Human Perception and Reasoning Benchmark for Large Vision-Languate Models

模型评测基准与评测资源

摘要

多维人类理解对于电影分析和虚拟数字人类等现实世界应用至关重要,但当前的 LVLM 基准主要侧重于单任务设置,缺乏细粒度、以人为中心的评估。在这项工作中,我们介绍了 MHPR,这是一种针对以人为中心的场景进行联合感知推理的综合基准,涵盖个人、多人和人与物体交互维度。 MHPR 包含多级数据设计(字幕原始数据 (C-RD)、监督 微调 数据 (SFT-D)、强化学习数据 (RL-D) 和测试数据 (T-D))以及自动字幕/VQA 生成管道 (ACVG),该管道执行按类别属性分解、特定属性重写和多模型投票,以确保高质量、可扩展的注释。我们评估细粒度属性(外观、服装、姿势、部位)和高级语义(社会关系、动作语义、空间关系、意图和功能)的最先进的视觉语言模型。我们的研究结果表明:1)格式对齐的 SFT 数据显着提高了指令跟随性和稳定性; 2)从坏案例分析中得出的以挑战为中心的强化学习数据进一步增强了对困难实例的感知和推理; 3) 使用 MHPR 训练 Qwen2.5-VL-7B 产生了显着的收益,与相当大的模型几乎达到了同等水平。我们发布 ACVG 和 MHPR,以促进以人类为中心的感知和推理的可重复、可扩展的研究。