论文

Omni-R1:迈向多模态推理的统一生成式范式

Omni-R1: Towards the Unified Generative Paradigm for Multimodal Reasoning

模型训练强化学习

摘要

多模态大语言模型(MLLM)在多模态推理上进展显著。早期方法聚焦纯文本推理。更近期的研究把多模态信息纳入推理步骤;然而,它们往往遵循单一的任务特定推理模式,限制了跨各种多模态任务的泛化性。事实上,众多多模态任务需要多样的推理技能,例如放大图像特定区域或在图像中标记物体。为此,我们提出统一生成式多模态推理,通过在推理过程中生成中间图像来统一多样的多模态推理技能。我们以Omni-R1实例化该范式,一个两阶段SFT+RL框架,配备感知对齐损失与感知奖励,从而实现功能性图像生成。此外,我们提出Omni-R1-Zero,它通过从纯文本推理数据自举(bootstrap)逐步可视化,免除了对多模态标注的需求。实证结果表明,Omni-R1在广泛的多模态任务上实现统一的生成式推理,而Omni-R1-Zero平均能达到甚至超越Omni-R1,为生成式多模态推理指明了一个有前景的方向。

Omni-R1:迈向多模态推理的统一生成式范式
图3:Omni-R1 与 Omni-R1-Zero 的训练流程。(上)数据初始化使用有限的人工标注(橙色)或合成的自举(bootstrapped)轨迹(蓝色)。(中)阶段1(PeSFT)以联合的交叉熵损失与感知损失进行监督微调。(下)阶段2(PeRPO)使用不含多模态标注的统一任务(左)以及复合奖励(Accuracy、Format、Perception)精炼策略,实现最终对齐。