论文

LVRPO:与 GRPO 的语言视觉对齐,用于多模态理解和生成

LVRPO: Language-Visual Alignment with GRPO for Multimodal Understanding and Generation

模型训练偏好优化

摘要

统一多模态预训练已成为在单个基础模型中联合建模语言和视觉的有前景的范例。然而,现有方法在很大程度上依赖于隐式或间接对齐信号,并且对于同时支持多模态理解和生成来说仍然不是最佳的,特别是在需要细粒度语言视觉推理和可控生成的环境中。在这项工作中,我们提出了 LVRPO,一种基于语言视觉强化的偏好优化框架,它使用组相对策略优化(GRPO)显式地对齐语言和视觉表示。 LVRPO 没有在表示层面引入额外的对齐损失,而是通过偏好驱动的强化信号直接优化多模态模型行为,鼓励跨理解和生成任务的语言和视觉之间一致且基于语义的交互。该公式无需辅助编码器或手工制作的跨模态目标即可实现有效对准,并自然地扩展到各种多模态功能。根据经验,LVRPO 在涵盖多模态理解、生成和推理的一系列广泛基准上始终优于强大的统一预训练基线。