论文
从运动到安全:MLLM 中主动风险推理的基准测试
From Sports to Safety: Benchmarking Proactive Risk Inference in MLLMs
摘要
及时预测物理危害对于现实世界的安全至关重要,但现有的 MLLM 评估侧重于有害内容或一般风险,而主动物理危害预测尚未得到充分探索。体育运动提供了一个非常合适的测试平台:事故原因涵盖不同的伤害维度,事故前的时空线索利用了与更广泛的安全领域(例如自动驾驶和跌倒检测)共享的推理能力。我们引入了 SPRINT(体育主动风险推理测试台),这是涵盖 14 项运动和 3 种环境设置的 2,888 个真实体育视频(2,440 个事故,448 个安全控制)的基准。事故视频对早期危险线索、事故时间和层次原因进行了细粒度注释;安全视频被手动验证为无事故,并用于诊断即时引起的误报。在不同的提示和时间窗口下评估最先进的 MLLM 揭示了危险敏感性和理解之间的巨大差距:最好的模型在发出危险信号方面超过 95%,但在识别其原因方面却低于 50%。诊断实验进一步表明,即使在无危险的视频上,明确的危险查询也会触发严重的误报。这些发现表明,当前的 MLLM 仅表现出肤浅的主动安全性,缺乏稳定、基于原因的早期预警,并强调在动态物理环境中需要可靠的主动安全性。数据和代码将在接受后开源。