论文
Omni-R1:迈向多模态推理的统一生成式范式
Omni-R1: Towards the Unified Generative Paradigm for Multimodal Reasoning
摘要
多模态大语言模型(MLLM)在多模态推理上进展显著。早期方法聚焦纯文本推理。更近期的研究把多模态信息纳入推理步骤;然而,它们往往遵循单一的任务特定推理模式,限制了跨各种多模态任务的泛化性。事实上,众多多模态任务需要多样的推理技能,例如放大图像特定区域或在图像中标记物体。为此,我们提出统一生成式多模态推理,通过在推理过程中生成中间图像来统一多样的多模态推理技能。我们以Omni-R1实例化该范式,一个两阶段SFT+RL框架,配备感知对齐损失与感知奖励,从而实现功能性图像生成。此外,我们提出Omni-R1-Zero,它通过从纯文本推理数据自举(bootstrap)逐步可视化,免除了对多模态标注的需求。实证结果表明,Omni-R1在广泛的多模态任务上实现统一的生成式推理,而Omni-R1-Zero平均能达到甚至超越Omni-R1,为生成式多模态推理指明了一个有前景的方向。
