论文

FineBench:用于细粒度人类活动理解的基准测试和增强视觉语言模型

FineBench: Benchmarking and Enhancing Vision-Language Models for Fine-grained Human Activity Understanding

模型评测基准与评测资源

摘要

视觉语言模型 (VLM) 在一般视频理解方面表现出了卓越的能力,但它们常常难以实现细粒度的理解,这对于需要对人类行为和交互进行细致入微的解释的现实世界应用至关重要。虽然最近的一些以人为中心的基准评估了模型行为的各个方面,例如公平/道德、情感感知和更广泛的以人为中心的指标,但它们没有结合长视频、非常密集的 QA 覆盖范围和大规模的帧级空间/时间基础。为了弥补这一差距,我们引入了 FineBench,这是一种以人为中心的视频问答 (VQA) 基准,专门用于评估细粒度的理解。 FineBench 包含 199,420 个多项选择 QA 对,这些对在 64 个长视频(每个 15 分钟)中进行了密集注释,重点关注详细的人物动作、人物交互和对象操作,包括合成动作。我们的广泛评估表明,虽然像 GPT-5 这样的专有模型取得了可观的性能,但当前的开源 VLM 表现明显不佳,特别是在多人场景中的空间推理以及区分人类运动和交互中的细微差异方面表现不佳。为了解决这些已发现的弱点,我们提出了 FineAgent,这是一个模块化框架,可通过利用定位器和描述符来增强 VLM。实验表明,FineAgent 持续提高了 FineBench 上各种开放 VLM 的性能。 FineBench 为未来以人为中心的细粒度视频理解研究提供了严格的测试平台,而 FineAgent 则提供了一种实用的方法来增强当前 VLM 中的此类推理。项目页面和代码位于 https://joslefaure.github.io/assets/html/finebench.html。