论文
TKCAM:文本和关键帧到相机轨迹生成
TKCAM: Text and Keyframe to Camera Trajectory Generation
摘要
生成高质量且可控的摄像机运动对于 AI 辅助电影摄影、视频合成和 3D 场景理解至关重要。我们介绍 TKCAM,一种基于生成掩模建模的文本和关键帧调节的 CAMera 运动合成框架。我们使用包含位置、速度和连续旋转表示的 12 维运动学特征来表示相机动态,并通过残差矢量量化器 (RVQ) 将它们离散化为分层运动标记。然后,两级屏蔽Transformer架构学习重建和细化这些标记,利用显式的自注意力和交叉注意力模块进行多模态调节。我们框架的一个核心功能是稀疏视觉关键帧调节:用户可以提供自由格式的文本提示以及选定时间戳的 RGB 观察结果,这为生成连贯的中间轨迹提供了时间局部视觉指导。此外,为了提高评估标准,我们策划了大型文本相机数据集RealEstate10K-Cap,并建立了跨域基准 使用通用 CLaTr 评估器。大量实验表明,TKCAM 在 Fréchet 距离 (FID)、文本运动匹配分数和检索指标 (R@K) 方面超越了最新的基线,同时还进行了额外的分析评估时间平滑性和跨域泛化。代码可在 https://github.com/linearalgebrayhz/TKCAM. 获取