论文
EgoSafe:第一人称移动捕捉视觉安全理解基准
EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding
摘要
在现实场景中可靠的视觉安全理解需要的不仅仅是物体识别;它需要在认知不确定性下进行因果推理。虽然大型视觉语言模型 (LVLM) 在标准基准上表现出令人印象深刻的语义一致性,但当基于第一人称体验的动态、部分可观察的性质时,它们常常难以区分表面相关性和真正的取证逻辑。现有的评估以第三人称监控录像和二元分类指标为主,未能揭示这种认知差距。为了解决这个问题,我们推出了 EgoSafe-Bench,这是一个专门为探索以自我为中心的安全场景中的取证推理而设计的基准。它包含 12,000 个独特的评估样本,这些样本是通过将 3,000 个视频剪辑中的每一个与由我们提出的分层推理评估 (HRE) 协议控制的 QA 链配对而生成的。与标准基准不同,HRE 要求从初始特征锚定到盲点推导和意图推理的严格推理轨迹,从而强制逻辑一致性并惩罚基于快捷方式的预测。对最先进的 LVLM(例如 Qwen3-VL、Gemini、VideoLLaMA 3)的广泛评估揭示了显着的感知推理解耦:模型通常会获得较高的描述性分数,但在因果推理和逻辑闭合方面表现出明显的脆弱性。我们的工作提供了一个具有挑战性的数据集和一个系统的评估框架,以促进逻辑上强大的视频理解系统的开发。