论文
OmniCam:基于几何约束姿态Token生成全景相机轨迹
OmniCam: Omni-Camera Trajectory Generation via Geometry-Grounded Pose Token Learning
摘要
摄像机轨迹控制视频生成、场景重建和机器人感知中的视点变化。从语言生成它们需要场景几何和目标感知框架。我们介绍 OmniCam,这是一种自回归模型,可以从单个全景图和文本轨迹描述生成相机姿势序列。其基于几何的姿势标记学习结合了三个组件:用于全向几何上下文的全景点云编码器;具有时间一致的四元数符号的混合绝对旋转和平移标记化;并使用显式 3D 目标锚点分离几何和语义条件流。我们还构建了 OmniCaT,其中包含跨越四种相机行为的 267,700 条轨迹。在报告的 OmniCaT 评估中,相对于在 OmniCaT 上重新训练的 GenDoP,OmniCam 将轨迹误差降低了 28--47%,碰撞率降低了 65.8%。与每个指标的最佳基线相比,ATE 和冲突减少分别为 43.0% 和 62.3%。组件消融支持使用几何和目标感知 调节,而下游实验则检查摄像机控制的视频生成和机器人主动感知。
