论文
视觉生成何时有助于统一多模态模型中的视觉理解?
When Does Visual Generation Help Visual Understanding in Unified Multimodal Models?
摘要
统一多模态模型(UMM)可以执行理解和生成,这就提出了一个核心问题:视觉生成可以提高理解吗?现有的评估提供了混合的证据,但混淆了任务难度、推理范式以及生成和理解之间的闭环交互。我们介绍 VGAU-Diag,一个用于视觉生成辅助理解的细粒度评估框架。它按难度对样本进行分层,支持对多种推理范式进行统一评估,并使用 Oracle 辅助参考协议。我们的分析表明,生成的视觉辅助工具有助于解决更简单的情况,但随着推理复杂性的增加而变得不可靠。 Oracle 辅助诊断进一步揭示,主要瓶颈往往在于视觉理解方面,而不是视觉生成方面,因为当前的 UMM 甚至难以利用可靠的视觉辅助工具。我们还表明,有效的视觉生成应该针对视觉理解瓶颈,而不是添加更多推理步骤,并确定从与任务无关的噪声到误导性的合理指导,最后到有用的帮助的三个阶段的过渡。这些发现将有助于指导更好的 UMM 的开发。