论文

打破双重瓶颈:将统一多模态模型发展为自适应交错视觉推理器

Breaking Dual Bottlenecks: Evolving Unified Multimodal Models into Self-Adaptive Interleaved Visual Reasoners

模型训练强化学习

摘要

最近的统一模型将多模态理解和生成集成在一个框架内。然而,“理解代沟”仍然存在,模型可以捕获用户意图,但往往无法将这种语义知识转化为精确的像素级操作。这种差距导致了任何图像任务(X2I)中的两个瓶颈:注意力纠缠瓶颈(盲目规划与复杂提示作斗争)和视觉细化瓶颈(非结构化反馈无法有效纠正缺陷)。在本文中,我们提出了一种新颖的框架,使统一模型能够根据指令复杂性和模型能力在生成策略之间自主切换。为了实现这一目标,我们构建了一个分层数据管道,该管道跨三种自适应模式构建执行路径:简单案例的直接生成、质量细化的自我反思以及分解复杂场景的多步骤规划。在此管道的基础上,我们提供了包含超过 50,000 个样本的高质量数据集,并实施了由 SFT 和 RL 组成的两阶段训练策略。具体来说,我们设计了逐步推理奖励以确保逻辑一致性和组内复杂性惩罚以防止冗余的计算开销。大量实验表明,我们的方法优于 X2I 上的现有基线,在简单到复杂的指令中实现了卓越的生成保真度。代码发布于https://github.com/WeChatCV/Interleaved_Visual_Reasoner。