论文
多模式无监督连续视觉依赖感知框架 后训练
A Visual Dependence-Aware Framework for Multimodal Unsupervised Continual Post-Training
摘要
在本文中,我们探索了多模态无监督连续 后训练 (MU-CPT) 的新任务,使部署的 MLLM 能够从流式未标记数据中不断发展。 MLLM 的现有无监督 后训练 方法通常会统一优化目标标记,而忽略其异构视觉依赖性 (VD)。然而,我们发现 词元级 VD 对于 MU-CPT 至关重要。具体来说,其结构扭曲是跨模式灾难性遗忘的指标,其固有的异质性充当指导新任务学习的指南针。利用这一特性,我们提出了一个具有两个主要组件的视觉依赖感知(VDA)框架。首先,视觉约束最优传输(VC-OT)将新任务学习期间旧任务 VD 的 VD 结构扭曲表述为最优传输问题,以减轻跨模态遗忘。通过设计区域感知的地面成本和依赖分层的运输惩罚,它可以防止视觉焦点的全局转移,同时严格禁止视觉依赖退化为语言偏见。其次,视觉调制适应(VMA)利用 VD 异质性来强调基于视觉的新任务学习,促进新任务的可塑性。总之,我们的方法在具有挑战性的 MU-CPT 过程中同时保持旧任务的稳定性和新任务的可塑性。我们的 MU-CPT 设置下的大量实验验证了 VDA 的有效性。