论文
视觉语言模型可以分析以人为中心的视频吗?映射模型功能和人机协作工作流程
Can Vision-Language Models Analyze Human-Centered Video? Mapping Model Capabilities and Human-AI Collaborative Workflows
摘要
视频提供了人类行为、互动和情境的丰富记录,为理解人类和开展以人为本的研究提供了重要证据。随着视觉语言模型 (VLM) 分析视频的能力越来越强,它们为实现这一传统的人力密集型流程的自动化提供了机会。然而,一个核心问题仍然存在:VLM 什么时候可以独立分析以人为中心的视频,什么时候可靠的分析仍然需要人类参与?为了解决这个问题,我们首先描述以人为中心的研究中的视频分析实践。我们系统地分析了所有 1,702 篇 CHI 2026 全文论文,并确定了 125 篇注释视频。通过迭代编码,我们得出了涵盖分析目的、观点、现象、推理要求和注释权威的五维分类法。基于该分类法捕获的重复注释任务,我们从开放数据集中构建了 15 个代表性任务的基准,以映射通用 VLM 的功能和局限性。我们通过比较三种注释工作流程来检查人类和 VLM 之间的分工:单独的 VLM、单独的人类以及人工验证 VLM 输出。在各个任务中,单独的 VLM 注释平均接近人类准确度(HNS = 97.0,其中 100 表示单独的人类性能),展示了以人类为中心的视频分析自动化的巨大潜力。人工验证实现了最高的准确度(HNS = 121.5),同时相对于人工标注,人工标注时间减少了 48.9%,金钱成本减少了 31.3%-44.5%。我们的研究结果将现实世界中以人为中心的视频分析任务和当前的 VLM 功能联系起来,并阐明了人机协作如何使 VLM 辅助分析可靠且高效。