论文
PerceptionDLM:具有多模态扩散语言模型的并行区域感知
PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models
摘要
多模态 大语言模型 (MLLM) 在视觉理解任务中取得了显着的进展。然而,大多数现有的 MLLM 依赖于自回归生成,这限制了它们执行需要为多个区域添加图像描述的感知任务的效率。在这项工作中,我们提出了 PerceptionDLM,一种针对高效并行区域感知而优化的多模态扩散语言模型。我们的架构基于 PerceptionDLM-Base(一个强大的基础基线,可在开源扩散 MLLM 中实现最先进的性能)构建,充分利用了 DLM 的并行解码特性。具体来说,我们引入了有效的提示和结构化注意掩蔽,以实现多个掩蔽区域的同时感知,从而允许模型在序列和标记级别并行生成区域描述。与顺序处理区域的现有方法相比,这种设计显着提高了推理效率。为了系统地评估 DLM 视觉感知能力的并行性,我们构建了一个新的并行详细本地化图像描述基准(ParaDLC-Bench),通过缩放 DLC-Bench 以包含每个图像的多个区域掩模,从而能够联合评估图像描述质量和推理效率。实验表明,PerceptionDLM 在区域图像描述方面保持了竞争性的性能,同时实现了多区域感知任务的显着速度提升。我们的结果凸显了多模态扩散语言模型在高效、并行视觉感知方面的潜力。据我们所知,我们是第一个利用扩散语言模型的优势实现并行区域描述和感知的。代码、模型和数据集已发布。