论文

ARM:具有统一离散表示的自回归大型多模态模型

ARM: An AutoRegressive Large Multimodal Model with Unified Discrete Representations

模型架构新型架构

摘要

本文介绍了 ARM,这是一种基于离散表示的自回归模型,它将图像理解、生成和编辑统一在下一个词元预测框架内。 ARM 基于三项工作:首先,我们训练离散语义视觉标记器,将图像映射为紧凑的标记序列。我们的分词器受到多个目标的监督,这些目标共同促进语义辨别性、语言对齐和忠实重建,从而支持共享潜在空间中的各种任务。由此,我们在大规模文本和图像标记序列上训练 7B 自回归模型,无缝开发视觉语言感知和生成能力。最后,为了进一步改进文本到图像生成和指令引导编辑的偏好一致行为,ARM 应用强化学习 (RL) 来优化任务级目标,例如视觉质量、指令依从性和编辑一致性。令人惊讶的是,结果表明 RL 不仅显着提高了目标任务的性能(例如,将 WISE 总体从 0.50 提高到 0.56,GEdit-Bench-EN G_O 从 5.75 提高到 6.68),而且还诱导了文本到图像生成和编辑之间的跨任务协同。总的来说,这些发现强调了自回归建模与强大的表示和偏好优化相结合,可以作为多模态智能的可扩展基础。代码:https://github.com/wdrink/ARM。