论文
模型指导您如何绘图:用于统一多模态推理的自适应视觉门控
Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning
摘要
具有交错推理的统一多模态模型(UMM)可以生成文本和视觉步骤作为中间推理轨迹的一部分,已经证明了视觉数学推理任务的巨大潜力。然而,我们在这个范式中发现了一个关键的见解:生成中间视觉推理步骤并不总是有益的,甚至可能是有害的,因为自我生成的视觉步骤可能会引入错误的视觉证据,从而误导后续推理。此外,在推理过程中频繁触发视觉步骤会产生大量的计算和内存开销,从而降低推理效率。为了解决这些准确性和效率挑战,我们观察到模型的内部信号可以在整个视觉生成完成之前指示视觉步骤是否有利于推理。具体来说,这项工作识别了两个内部信号:1)生成意图,反映模型是否对要绘制的内容有具体的文本计划;2)视觉保真度,衡量视觉生成是否仍然基于于原始输入图像。利用这些内部信号,我们提出了 AdaViG,一种用于统一多模态推理的 无需训练 自适应视觉门控方法。 AdaViG 在早期视觉生成阶段动态评估每个触发的视觉步骤,并在两个信号都很弱时中止它,从而防止误导性视觉证据进入推理轨迹,同时避免不必要的计算。综合实验表明,AdaViG 将准确率提高了 5.7%,同时将视觉生成 FLOP 减少了 25.0%-91.0%,将挂钟延迟减少了 15.4%-45.6%。