论文
OVO-S-Bench:多模式流空间智能的分层基准 LLM
OVO-S-Bench: A Hierarchical Benchmark for Streaming Spatial Intelligence in Multimodal LLMs
摘要
机器人、增强现实和自动驾驶中的多模式代理必须从连续的以自我为中心的流中推理位置和布局,通常使用当前视图之外的证据。现有的基准要么评估完整视频的离线状态,要么评估目标事件,而不是评估空间结构。我们推出了 OVO-S-Bench,这是一个完全由人工注释的流空间智能基准,包含 348 个源视频中的 1,680 个问题。注释涉及 12 名训练有素的注释员(每人还充当盲人交叉审阅者),进行约 804 人时的多轮质量保证。每个问题都带有查询时间戳和证据间隔,并且在评估时,模型仅看到查询之前的前缀。问题跨越四个日益抽象的层次:瞬时自我中心感知、时空背景跟踪、生成空间推理和异中心空间映射。在 38 个专有和开源 MLLM 中,Gemini-3.1-Pro 落后于在相同前缀访问协议下评估的人类专家 33 分(59.2 比 92.2),异中心空间映射是主要瓶颈。值得注意的是,流式传输和空间微调 MLLM 的性能较差。我们进一步发现,当思想链推理在信息流中缺乏基础时,会放大空间错误。通过暴露这些限制,OVO-S-Bench 为下一代流空间 MLLM 建立了一个要求严格的测试平台。