论文
Cambrian-P:基于姿势的视频理解
Cambrian-P: Pose-Grounded Video Understanding
摘要
相机姿势很重要。每个视点的位置和方向定义了一个共享的空间坐标系,该坐标系将跨视频帧的观察结果联系起来。然而,用于视频理解的多模态 LLM (MLLM) 基本上不存在这种信号,它将帧处理为孤立的 2D 快照,而不是人类感知的持久场景。我们重新审视姿势作为轻量级监督信号,并引入 Cambrian-P,这是一种视频 MLLM,增强了每帧可学习的相机标记和姿势回归头。通过精心设计的采样方案,该模型在 VSI-Bench 等空间推理基准上实现了 4.5-6.5% 的大幅提升,概括了八个额外的空间和通用视频 QA 基准,并且作为副产品,在 ScanNet 上实现了最先进的流式姿态估计。令人惊讶的是,对野外视频中的伪注释姿势进行训练进一步改善了一般视频 QA 基准,表明姿势有助于超越空间推理。总之,这些结果将相机位置作为推理物理世界的视频模型的基本信号。