论文
OmniTaskonomy:视觉生成何时可以提高视觉理解?
OmniTaskonomy: When Does Visual Generation Improve Visual Understanding?
摘要
训练模型生成视觉内容可以鼓励其学习与几何、空间关系和客观性相关的丰富感知能力;然而,它对视觉理解的好处仍不清楚。我们问:视觉生成监督何时以及如何提高视觉理解?我们研究图像到图像(I2I)生成和图像到文本(I2T)理解任务的受控对,这些任务以不同的输出模式表达相同的潜在问题。我们发现,在正确的方案下,I2I 训练可以提高下游 I2T 性能,并且随着 I2I 训练数据量的增加,收益会更大。接下来我们要问哪一代任务有利于哪些理解能力。为了研究配对任务之外的迁移,我们引入了 OmniTaskonomy,这是一个涵盖 19 个 I2I 生成任务和 25 个 I2T 理解功能的统一分类法。由此产生的转移图揭示了选择性的、依赖于任务的好处。有些遵循直观的对应关系,例如,深度预测改进了度量 3D 推理,对象指向改进了计数,拼图重建改进了 2D 排序。有趣的是,我们还发现了令人惊讶的联系:2.5D 分割改善了类别识别,Z 深度预测改善了定位。为了探究这些模式,我们分析了生成任务和理解任务之间的梯度对齐,发现更强的对齐与更大的下游转移增益相关。总之,我们的结果强调了视觉生成作为视觉理解监督的丰富来源,并提供了通过正确的训练课程和任务选择来释放其好处的路线图。项目页面:https://omni-taskonomy.github.io/.