论文
LLaVAFlow:为参数高效的多模态保留潜在对齐流 微调
LLaVAFlow: Preserving Latent Alignment Flow for Parameter-Efficient Multimodal Fine-Tuning
摘要
虽然多模态 大语言模型 (MLLM) 表现出很强的泛化能力,但下游任务的视觉指令调整不可避免地会导致灾难性的遗忘,从而损害整体泛化能力。虽然现有方法调节权重更新以减少遗忘,但它们忽略了 MLLM 中基本的跨模式对齐。根据之前的工作和我们的观察,我们认为跨模式对齐是在信息压缩轨迹中隐式捕获的。为了保留嵌入轨迹中的对齐流,我们提出了 LLaVAFlow,一个信息论 蒸馏 框架。首先,我们压缩提取的关系和 MLLM 嵌入之间的互信息,鼓励可学习模块产生有利于下游任务的精细对齐流程。其次,我们最大化了预训练和微调的 MLLM 提取的对齐流之间的互信息,从而实现紧凑的对齐信息的传输。大量实验表明,LLaVAFlow 是一种有效的即插即用框架,可以保留对齐流并增强下游性能和泛化能力。