论文

并非所有模态都是平等的:多模态视频的指令感知门控

Not All Modalities Are Equal: Instruction-Aware Gating for Multimodal Videos

模型架构Transformer

摘要

预训练视频 大语言模型 擅长视觉推理。然而,当视频带有辅助流(例如音频、深度图或密集的时间证据)到达时,它们会遇到困难。在这种情况下,统一融合会引起模态干扰,从而使不相关的通道分散模型的注意力。为了解决这个问题,我们提出了一个统一的多模态视频理解框架,名为 UniMVU,它通过两个级别的动态门控跨视频、音频、深度图或任何其他模态输入执行指令感知融合:内部模态门强调每个模态内的显着区域,而模态级门重新加权整个流;两者都以文本指令为条件,以自适应地平衡模态重要性。我们的 UniMVU 将跨模态自注意力与指令驱动的内部模态门控模块以及带有控制词元的模态级门控模块相结合;对于时间对齐的流,我们进一步采用从快到慢的融合方案来减少冗余。在六个基准测试(AVQA、AVSD、Music-AVQA、ScanQA、SQA3D 和 MVBench)中,我们的 UniMVU 比静态融合基线实现了一致的增益,在 CIDEr 指标方面实现了高达 13.5 的增益。此外,我们的分析表明,门控机制与人类可解释的模态相关性一致,并且消融显示了内部模态和模态级门控的贡献。我们的 UniMVU 为指令感知多模态视频理解提供了一个简单、统一的方案,可以扩展到多种模态,无需手工制作的融合规则。