论文
RefereeBench:视频 MLLM 准备好成为多项运动裁判了吗
RefereeBench: Are Video MLLMs Ready to be Multi-Sport Referees
摘要
虽然多模态 大语言模型 (MLLM) 擅长通用视频理解,但其支持专门的、基于规则的决策的能力仍未得到充分探索。在本文中,我们介绍了 RefereeBench,这是第一个用于评估 MLLM 作为自动体育裁判的大规模基准。 RefereeBench 涵盖 11 项运动项目、925 个精选视频和 6,475 个 QA 对,评估五种核心裁判能力:犯规存在、犯规和处罚分类、犯规和处罚推理、实体感知和时间基础。该基准完全由人工注释,以确保基于真实的裁判逻辑和多模态证据的高质量注释。对最先进的MLLM的广泛评估表明,即使是最强的模型,如Doubao-Seed-1.8和Gemini-3-Pro,也只能达到60%左右的准确率,而最强的开源模型Qwen3-VL也只能达到47%。这些结果表明,当前的模型距离成为可靠的体育裁判还很远。进一步的分析表明,虽然模型通常可以识别事件和涉及的实体,但它们在规则应用和时间基础上遇到困难,并且经常对正常剪辑吹罚犯规。我们的基准强调了未来 MLLM 需要更好地整合领域知识和多模式理解,推进值得信赖的人工智能辅助裁判和更广泛的多模式决策。