论文
桥接交错思维中的模态隔离:通过逐步强化监督模态转换
Bridging Modal Isolation in Interleaved Thinking: Supervising Modality Transitions via Stepwise Reinforcement
摘要
交错思维,即统一的多模态模型在文本推理和视觉生成之间交替,在空间和物理任务上显示出了希望。然而,在复杂的长链场景中,我们确定了一种基本的失败模式:生成的图像与文本上下文相背离,而后续文本忽略了视觉证据,导致两种模式交替使用而没有真正相互通知。我们将这种现象称为模态隔离,并将其归因于模态边界处的复合信息丢失。我们将每个推理周期分解为原子操作,并定义模态转换损失,量化每个边界处的跨模态幻觉(文本到图像)和视觉利用缺陷(图像到文本)。我们提出了 MoTiF(Modality Tiransition Fidelity),这是一个直接优化这些转换的两阶段训练框架:反射 SFT 训练模型以检测错误的视觉输出并从中恢复; Flow-GRPO 通过强化学习提高图像生成保真度。 MoTiF 中的所有训练信号都源自转换级保真度,而不是最终任务的准确性。在四个视觉谜题基准中,这种过渡级监督极大地提高了跨模式一致性和最终任务准确性。结果表明,有效的交错推理需要在模态边界进行明确的结构监督,而不仅仅是缩放或最终任务优化。