论文

CRePE:用于统一相机控制视频生成的弯曲光线期望位置编码

CRePE: Curved Ray Expectation Positional Encoding for Unified-Camera-Controlled Video Generation

模型架构Transformer

摘要

视频世界模型应该以与 3D 场景结构、摄像机运动和镜头几何保持一致的方式预测未来的外观。然而,现有的注意力级相机编码要么仅通过其观看光线来描述每个标记,而不沿着该光线定位场景内容,要么采用针孔投影,限制广角和鱼眼镜头下的相机控制。我们引入了曲线射线期望位置编码(CRePE),它将每个图像标记表示为沿着其统一相机模型(UCM)射线的深度感知分布,并在投影到每个查询视图时沿着该分布跟踪的弯曲路径集成预期旋转位置相量。 CRePE 是通过冻结视频扩散 Transformer 上的轻量级几何注意力适配器实现的,并具有来自单目几何基础模型的伪径向距离监督,充当稳定锚点而不是推理时间输入。 CRePE 改进了针孔、广角和鱼眼设置中的摄像机控制、镜头和方向保真度,并将零镜头转换为看不见的真实鱼眼和各种针孔视频。通过Radial MixForcing,相同的位置路径进一步接受外部提供的径向贴图,从而实现场景几何条件生成和源视频运动传输,比专用深度条件基线更忠实地遵循所提供的几何形状。因此,CRePE 提供了一个紧凑的界面,统一了摄像机控制、隐式 3D 场景状态和视频世界模型的外部几何控制。