论文

TennisVAR:基于击球证据的多模态 大语言模型,用于网球视频中的战术推理

TennisVAR: A Stroke-Evidence-Grounded Multimodal Large Language Model for Tactical Reasoning in Tennis Videos

模型训练监督微调与指令调优

摘要

体育视频理解正在超越事件识别,转向解释动作如何共同塑造比赛进程,然而,现有的网球视频方法要么在不建模其战术依赖关系的情况下感知单个击球,要么在不将其扎根于潜在事件的情况下生成高级分析。为了弥合这种感知与理解之间的差距,我们制定了基于击球证据的战术推理,这是一项新的集会级任务,需要模型共同预测开放式答案、分层战术标签、支持击球的有序序列和决定性的关键动作,每个证据击球都锚定到其球拍接触框架。我们进一步介绍了 TRACE(Tactical Reasoning with Action-Chain Evidence in Tennis),这是一个大规模的专家注释基准,包含 11,189 个拉力赛视频、41,485 个击球事件、25,429 个战术单元和 11,189 个问答对,它统一了细粒度的击球属性、跨击球战术关系、分层战术注释以及跨越事实感知、战术理解和决策的基于证据的问题推理。在 TRACE 的基础上,我们提出了 TennisVAR(网球视频动作链推理器),这是一种基于证据的多模式 大语言模型,遵循“事件-关系-证据-策略”推理范式,其中事件解析模块将连续集会转换为明确的击球事件序列,而战术图引导时间推理器联合建模集会进展和同一玩家决策依赖性,以识别与问题相关的证据和决定性行动。