论文

视频-LLM真的可以看吗?诊断长视频中的角色跟踪故障

Do Video-LLMs Actually Watch? Diagnosing Character-Tracking Failures in Long-Form Video

模型评测模型能力评测

摘要

视频 大语言模型 (Video-LLM) 能否跟随一个人观看一段长视频,跟踪他们的健康状况,以便按顺序报告他们的服装在整部电视剧中如何变化?基准测试对此类任务的评分越来越高,最强的开源 7--8B 模型现在在 InfiniBench 的全局外观任务中达到了 37--38%,这正是要求的。但这个分数是来自跟踪指定角色,还是来自更简单的东西?我们将九条件诊断协议应用于三个架构不同的开源Video-LLM,以Gemini~2.5~Flash作为前沿参考,进行测试,发现准确性并非来自角色跟踪。当我们将问题中指定的角色更改为其他演员,同时保持视频和答案选项不变时,模型仅在 4--31% 的情况下更改答案,因此他们在很大程度上忽略了问题所问的对象。通过交换名称的性别来分解该测试可以看出原因:当名称更改为不同性别角色时,模型的反应比更改为同性别角色时反应更大(13--28分差距),识别出粗略的性别线索,但无法区分同性别个体。当我们放弃多项选择选项并开放式地提出相同的问题时,这种浅层处理再次浮出水面:开源准确率下降了 18--25 分,151 个答案中没有一个完全正确,而 Gemini 则下降了 12 分。进一步的检查排除了明显无辜的解释,添加字幕,使用信息最丰富的帧,或者将帧数加倍,所有这些都会导致角色跟踪未得到改善,因此瓶颈不在于模型看到了多少视频,而在于如何将视频与问题名称的人联系起来。我们发布了一个诊断工具包,用于审核此类基准分数的实际测量结果。