论文

将交错多模态推理桥接为统一决策过程

Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process

模型训练强化学习

摘要

统一多模态模型(UMM)已展现有前景的交错文图推理能力——但经强化学习(RL)有效优化此类多轮生成仍是开放挑战。既有方法仅对文本步骤应用RL——将图像生成降格为监督代理——阻止策略梯度穿越异构模态的完整交错轨迹。这使RL对UMM的潜力基本未被开发。本文中——我们引入BRAID(将交错多模态推理桥接为统一决策过程)——简单框架:将多轮文-图-文推理投射为统一马尔可夫决策过程(MDP)——经由单一、有原则的RL目标实现文本与视觉生成的联合优化。BRAID计算共享的轨迹级优势——并将其连贯地传播到文本token与图像去噪路径——每条路径经其模态原生策略梯度机制优化。为进一步解决长程信用分配——BRAID采用视觉语言模型(VLM)裁判为每张中间图像的推理效用打分——提供密集的轮级反馈以锐化关键视觉分支的学习。空间推理与视觉感知基准上的实验表明BRAID持续超越各基线——确认统一MDP形式化加视觉思考引导对有效多模态推理必不可少。

将交错多模态推理桥接为统一决策过程:论文配图
图 1:SFT、半优化 RL 和 BRAID。