论文
根据不相交数据进行统一视频密集预测
Unified Video Dense Prediction from Disjoint Data
摘要
场景理解需要同时预测几何、外观和语义。然而,现有的特定于任务的注释分散在不兼容的、特定于域的数据集中。当前的统一系统通过将训练限制在完全共同注释的数据上,或者通过产生伪标记的大量计算成本来规避这一点。为了缓解这个问题,我们引入了 UniD,这是一个统一的视频模型,它联合预测八个密集场景属性——深度、表面法线、语义分割、边界、人体部位、反照率、阴影和材质——所有这些属性都是从不相交的、特定领域的数据集中学习的。我们提出了一个简单而有效的 蒸馏 步骤,其中每个任务专家通过轻量级任务投影仪监督统一的骨干网,消除了注释重叠或伪标签的需要。我们的主要见解是,预训练扩散模型的强大视觉先验足以弥合由不相交的训练源引入的领域差距,从而能够对训练期间从未见过的场景任务组合进行稳健的泛化。 UniD 实现了与每任务专家和多任务基线相比的竞争性能,对分布外场景具有强大的泛化能力,并增强了时间和跨任务一致性。代码和视频结果可在 https://unid-video.github.io/ 获取。