论文
OrthoMotion:通过几何语义正交注意解开相机和主体运动
OrthoMotion:Disentangling Camera and Subject Motion via Geometry Semantics Orthogonal Attention
摘要
可控视频生成需要对摄像机和拍摄对象进行独立控制,但 2D 调节将它们纠缠在一起:摄像机和物体引起的光流共享相同的逆深度 (1/Z) 缩放,并且无法单独与图像证据分开。我们首先证明这种纠缠是代表性的,而不是架构性的——2D 相机/对象分割是一个不可识别的逆问题——因此将解耦重新定义为操作符设计的问题。我们在注意力算子的层面上解决它。 OrthoMotion 将相机运动路由到几何通道、旋转位置嵌入 (RoPE) 阶段的范数保持旋转,并将主体运动路由到语义通道、交叉注意力中的门控值注入。因为这些子运算符在代数上是互补的(词元上仿射作用的旋转与平移),所以轻量级解耦正则化器可以将它们的响应子空间驱动到正交性,因此两个控件停止干扰。据我们所知,OrthoMotion 是第一个通过构造来保证解开而不是希望它出现的方法。它同时实现了最先进的相机和拍摄对象精度,同时最大限度地减少了串扰,我们使用新的串扰误差 (CTE) 指标进行量化,将串扰减少了 2.4 倍以上,且保真度没有损失,并且可以跨主干网进行推广。