论文

用于结构化视觉识别的模块化扩散模型

Modular Diffusion Models for Structured Visual Recognition

模型架构新型架构

摘要

用于结构化视觉识别任务(例如对象检测、分割和场景图生成)的传统监督方法通常会产生确定性的固定输出,限制了它们捕获复杂视觉场景中固有的不确定性的能力。因此,此类点估计无法捕获这些问题固有的预测不确定性(或多模态),这些不确定性通常是由自然模糊性(例如,部分遮挡对象的大小模糊性、精确分割边界的局部模糊性等)以及训练数据的噪声和稀疏性引起的。为了解决这个限制,我们提出了模块化扩散模型(MDM),这是一种简单而新颖的框架,可以学习给定输入图像的结构化输出的分布。 MDM 将扩散过程分解为不同的、特定于任务的模块,每个模块专注于捕获结构化信息空间的不同方面,例如对象类别、空间位置和对象间关系。这种模块化设计允许每个组件独立学习,无需额外训练即可在推理时无缝集成。此外,MDM 的模块化使扩散过程能够轻松地在许多结构化学习任务中常见的异构输出空间(例如,连续边界框和离散类标签)上运行。三个不同的结构化任务(对象检测、实例分割和场景图生成)的实验结果突出了我们提出的框架的优点。