论文
逆转流程:大型多模式模型中从生成到理解的协同作用
Reversing the Flow: Generation-to-Understanding Synergy in Large Multimodal Models
摘要
多模态人工智能的长期目标是建立视觉理解和视觉生成相互增强的统一模型。尽管最近有 BAGEL 等工作,但 BLIP3o 取得了显着的进展;然而,在实践中,这种统一仍然是单向的:理解通常指导生成,但很少研究生成如何以及为何支持理解。我们重新审视这种不对称性,并提出生成到理解(G2U)的协同作用,其中视觉生成成为一个明确的中间推理步骤。我们的框架使模型能够执行受控的生成行为,例如细节增强、上下文扩展或结构可视化,以产生自我生成的视觉思维,然后将其反馈到模型中以完善感知,而无需重新训练或外部工具。通过对十二个基准的综合评估,这种反向信息流不断提高多模式理解。我们表明,生成保真度限制了感知增益,并且不同的编辑提示家族控制着传输效率。我们进一步分析模型是否可以决定想象什么。虽然它们可以产生看似合理的编辑,但这些自我生成的视觉想法缺乏稳定的任务对齐,这表明当前的大型多模态模型缺乏真正的自我反思。这项工作揭示了统一认知中缺失的机制,并表明想象力不是理解的终结,而是理解的开始。