论文
Argus-Unified:面向图像理解和生成的紧凑且经济的统一模型
Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation
摘要
在一个模型中统一视觉理解和生成具有巨大的前景,但由于繁重的计算和数据需求以及这两种功能所需的视觉特征之间的冲突,仍然具有挑战性和昂贵的。为了应对这些挑战,我们推出了 Argus-Unified,这是一种紧凑、有效且统一的多模态模型,对计算和数据的需求较低。 Argus-Unified 不是从头开始调整模态,而是有效地利用预训练的视觉语言模型 (VLM),提供强大的多模态先验。具体来说,我们引入了混合视觉标记,它保留连续标记以供理解,同时学习离散标记以从冻结的统一视觉编码器生成。我们的训练流程包括两个阶段:第一阶段在冻结视觉编码器之上学习量化器和图像解码器,第二阶段训练从预训练的 VLM 初始化的 LLM,以实现统一的多模态建模。使用迄今为止最少的数据量(1560 万)和最低的成本(约 2,000 美元),我们证明可以经济地训练统一的多模态模型,同时在理解和生成方面实现强大的性能。值得注意的是,与使用专用视觉编码器(例如 Janus、Janus-Pro)的模型相比,我们的模型在 GQA、POPE 和 VQAv2 上实现了最先进的多模态理解,并且具有具有竞争力的生成质量,所有这些都以约 10 倍的成本降低和约 5 倍的数据减少。我们设想 Argus-Unified 作为一个有用的基线,可以降低统一模型的开发障碍。