论文
OmniPro:全方位主动流媒体视频理解的综合基准
OmniPro: A Comprehensive Benchmark for Omni-Proactive Streaming Video Understanding
摘要
全主动流视频理解,即从连续的视听流中自主决定何时说话以及说什么,是全模态 大语言模型 的一项新兴功能。现有的基准在三个关键方面存在不足:它们主要依赖于视觉信号,采用轮询或固定时间戳协议而不是真正的主动评估,并且仅涵盖有限的任务范围,从而阻碍了全主动流模型的可靠评估和区分。我们推出 OmniPro,这是第一个联合评估全模态感知、主动响应和多样化视频理解任务的基准。它包含 2,700 个经过人工验证的样本,涵盖 9 个子任务和 3 个认知级别,涵盖 6 种基本视频理解能力。值得注意的是,84% 的样本需要音频信号(语音或非语音),并且每个样本都用模态隔离标签进行注释,以实现细粒度的多模态分析。我们进一步引入了双模式评估协议:探测模式通过在每次 真值 触发之前和之后查询模型来评估内容理解,而在线模式则通过要求模型自主决定何时响应流输入来评估完全主动能力。评估 11 个代表性模型揭示了三个关键发现:(1) 音频提供了一致的增益,但模型之间的利用率差异很大;(2) 性能随着时间的推移而显着下降,表明长期鲁棒性有限;(3) 非语音音频感知仍然是最弱的维度。