论文
SVI-Bench:战略视频智能的动态微观世界
SVI-Bench: A Dynamic Microworld for Strategic Video Intelligence
摘要
真正的视频智能需要的不仅仅是识别可见的内容:它需要推理事件发生的原因,预测在不同条件下会发生什么变化,并决定下一步该做什么。我们将这种从感知到因果推理和模拟再到战略规划的过程称为战略视频情报(SVI)。现有的基准测试没有评估此功能堆栈:野外视频缺乏针对因果和战略问题的可验证 真值,而合成环境则牺牲了真实多智能体系统的复杂性。为了弥补这一差距,我们引入了 SVI-Bench,这是一个大型基准,它将团队运动作为一个动态的微观世界,将现实世界多智能体交互的复杂性(10-22 个智能体在对抗压力下做出协调决策)与明确规则和明确结果的可验证性结合起来。 SVI-Bench 包含篮球、足球和曲棍球领域约 35,000 小时的广播视频、1500 万个带注释的动作、15,000 小时的专家评论、23,000 份比赛报告以及 103,000 份结构化统计记录,所有这些都是通过数据引擎构建的,该引擎将原始比赛数据转换为密集的、交叉引用的语料库。我们将评估分为 9 项任务,跨越渐进的四支柱层次结构:动态场景理解、因果推理、策略模拟和代理综合。通过评估强大的多模态和代理基线,我们发现了一个能力悬崖:模型在感知任务上表现出色,在细粒度动作 QA 上达到了约 74%,但在每个连续的认知水平上急剧下降。代理任务被证明是最困难的:当需要在 180 万个剪辑的语料库中自主收集和整合证据时,最强大的模型只能达到 5% 的准确率。