论文
通过非对称互变学习进行多模态连续推理
Multimodal Continuous Reasoning via Asymmetric Mutual Variational Learning
摘要
多模态 大语言模型 (MLLM) 通常受到语言空间瓶颈的限制,迫使复杂的视觉推理变成离散的标记,这可能会失去感知的细微差别。一个有前途的替代方案是连续潜在推理,其目标是发现连接多模态查询和最终答案的隐式推理路径。然而,这引入了严重的训练推理不匹配:以 真值 答案为条件的训练时间后验可以利用依赖于答案的快捷方式。然后,标准变分训练会强制推理时间先于模拟后验,该后验可以访问测试时不可用的信息,从而导致性能不佳。为了解决这个问题,我们提出了非对称互变学习(AMVL),这是一个通过双向校准目标解决这种不匹配的框架。前向 KL 散度在匹配后验之前训练目标不可知论,而新颖的反向 KL 散度同时规范后验,防止其崩溃到推理不兼容的区域并减轻这种“答案泄漏”。我们提供理论分析,将这种泄漏形式化为先前的污染,并证明我们的双 KL 目标可以减少泄漏。我们在潜在集成 MLLM 中实例化 AMVL,并表明它始终优于强大的离散和潜在推理基线,将复杂 BLINK 基准的平均得分提高了 +10.83,并在单个推理任务上实现了高达 +32.00 的增益,分析证实了潜在空间稳定性的提高。