论文

Gestalt:大型多模态相互作用模型

Gestalt: Large Multimodal Interplay Model

模型架构新型架构

摘要

在本文中,我们提出了格式塔(Gestalt),这是一种围绕多模态相互作用构建的大型多模态模型的新范式。尽管取得了快速进展,大型多模态模型正在遇到瓶颈:现有方法主要侧重于容纳额外的模态,而忽视了每种模态的独特特征以及它们之间的关系。受人类多感官感知的多阶段特性的启发,我们提出了一个多模态相互作用金字塔,它将多模态建模组织为从模态特定处理、跨模态对齐到更深层次的多模态集成的进展。在这个金字塔的指导下,格式塔采用了统一的离散扩散框架和交互分区架构,并通过可学习的交互词元来调解跨模态交换和集成。金字塔还构建了其数据组织和训练策略。在图像生成、多模态理解和纯文本评估方面的出色表现表明,Gestalt 显着改善了跨模态集成,同时保留了模态特定信息,有效利用了基于扩散的多模态模型的优势,并为统一多模态智能提供了一条有前途的道路。