论文

混合探测:通过探测从多模态 LLM 中的特权模式中学习

Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing

模型训练监督微调与指令调优

摘要

多模态 大语言模型 (MLLM) 通常是在这样的假设下设计的:训练期间可用的所有模态也可以在推理时访问。然而,许多现实世界的设置违反了这一假设,要求模型在特权模式设置下运行,其中辅助模式仅在训练期间可用。虽然这些模式包含有价值的信息,但现有的 MLLM 基本上无法有效利用它们,因为它们将模式视为可互换的输入,而不是补充监管的来源。我们提出了探针混合(MoP),这是一种新颖的框架,可以在 MLLM 中解开模态特定信号和模态通用信号,使模型能够保留模态相关的结构,同时学习跨模态的可转移表示。 MoP 的核心是通过结构化探测机制来实现这一目标,该机制从共享模态编码器的中间表示中提取和组织信息,而不是像现有 MLLM 那样仅依赖于最终层对齐。为了支持这种解开,我们进一步引入了 MoP 跨模态训练(MoP-X),这是一种以探针解开损失为中心的 MoP 训练策略,可防止探针崩溃并鼓励跨模态学习。我们在针对特权模态设置量身定制的综合评估协议下评估跨越八个任务和四种模态的两个领域的 MoP,其中每种模态在推理时都被独立地视为唯一输入。 MoP 始终优于强大的 MLLM 基线,实现了高达 65% 的相对改进,这表明辅助模式即使在推理时不可用,在训练期间有效利用时也可以提供实质性收益。代码、模型检查点和评估协议将在 https://github.com/Sony/MoP 上提供。