论文

使用不断变化的数据进行相互对抗的自我训练,以实现统一的多模态模型

Mutually Adversarial Self-Training with Evolving Data for Unified Multimodal Models

模型训练强化学习

摘要

统一多模态模型 (UMM) 将图像生成和视觉理解结合在共享主干中。由于生成和理解是逆任务,最近的研究通过让两个分支相互协作监督来自我训练 UMM。我们引入了 MATE(使用不断变化的数据进行相互对抗的自我训练),这是一种基于强化学习的后训练框架,其中两个分支相互挑战,并且挑战随着模型训练而演变。 MATE 让生成和理解轮流成为挑战者和解决者。给定图像,理解分支提出几个候选描述,生成分支必须将这些描述转回相似的图像,反之亦然。筛选候选者是否与提出建议的图像或提示保持一致,并且求解器接受其处理最差的候选者的训练。因此,对手来自模型自己的输出,并且没有训练单独的对手。此外,击败一个分支的候选者成为下一个时代另一个分支的下一个挑战的来源,这使得挑战随着模型的发展而变化,并将训练转变为数据空间中的自我博弈。在 Janus-Pro-1B 上,MATE 将 GenEval 提高了 2.4 点,DPG-Bench 提高了 1.7 点,九个理解基准的平均值提高了 0.7 点,同时增强了重复图像-文本循环的一致性。