论文
SCoPE:视频扩散的视线坐标位置编码 Transformer
SCoPE: Sightline-Coordinate Positional Encoding for Video Diffusion Transformers
摘要
视频扩散 Transformer 通过像素时间网格上的位置来寻址它们的标记:张量中的地址,而不是世界中的地址。我们想要的地址,即词元描绘的世界点,位于尚未生成的表面上,而一旦用户指定了轨迹,其相机光线就固定了。因此,SCoPE 将射线视为第二个位置坐标,并且相机控制成为坐标系的属性,而不是添加的模块。该射线被添加到预训练注意力的查询和键中,并且分数获得单独读取两条射线的术语。它的规范形式是线几何的倒数,衡量两条视线相交的程度。 Normalize-Gate-Inject 使单个编码可跨度量和高达比例的姿势源进行训练。改造保持 RoPE 位精确,从未更改的预训练 DiT 开始,并添加低于 0.1/% 的新参数。在匹配数据和预算的 5B 和 14B 的 Wan2.2 上,SCoPE 改进了每个摄像机的可控性和保真度指标,领先于所有闭环重访指标,并显示出随着模型大小而扩大的裕度。在 14B 处,旋转误差下降 29/%,FVD 下降 43/%,低于最强基线。