论文
通过几何 知识蒸馏 进行时间对齐组合相机运动理解
Temporally Grounded Compositional Camera Motion Understanding via Geometric Knowledge Distillation
摘要
了解相机运动是视频感知的基础,可应用于空间智能和可控视频生成。多模态 大语言模型 (MLLM) 为这项任务提供了一个自然的界面,但现有的工作通常为整个剪辑分配一个或多个标签。这种剪辑级识别忽略了真实摄像机运动的两个定义属性:它可以在一个镜头内发生变化,并且多个运动可以同时发生。因此,我们将相机运动理解制定为基于时间的构图识别,这需要一个模型来定位运动一致的间隔并识别每个间隔内活跃的每个运动。我们推出 CamChoreo,这是一个包含 4,229 个真实单镜头剪辑(带有专家注释的时间段)的基准。其注释使用由 20 个方向感知标签组成的紧凑词汇表,近一半的片段包含复合相机运动,多个运动基元同时活动。对于当前的 MLLM 来说,识别这种细粒度的组合运动很困难,其视觉编码器强调语义内容,而不是相机运动所依赖的几何证据。直接从冻结的 3D 基础模型注入特征可以解决这一问题,但需要在每个输入上运行昂贵的几何模型;我们将此基线称为 CamInject。相反,我们提出了 CamDistill,它在训练期间将相同的几何知识提炼成轻量级相机标记,并在推理时删除 3D 模型。 CamDistill 与直接特征注入的准确性相匹配,无需在推理时运行 3D 教师。 CamChoreo 和 CamDistill 共同推进相机运动理解,从剪辑级标签到基于时间的构图识别。项目页面:https://ddz16.github.io/cammotion.github.io/。