论文
CoLA:多模态下游任务的跨模态低秩适应
CoLA: Cross-Modal Low-rank Adaptation for Multimodal Downstream Tasks
摘要
基础模型彻底改变了人工智能,但如何有效地使其适应多模态任务,特别是在由单模态编码器(例如 DINO 和 BERT)组成的双流架构中,仍然是一个重大挑战。 LowRank Adaptation (LoRA) 等 ParameterEfficient 微调 (PEFT) 方法可实现轻量级自适应,但它们在每种模态中独立运行,限制了它们捕获跨模态交互的能力。在本文中,我们采取了一步,通过跨模态低秩适应(CoLA)来弥补这一差距,这是一种新颖的 PEFT 框架,通过在标准模态内适应路径之外引入专用的模间适应路径来扩展 LoRA。这种双路径设计使 CoLA 能够有效地将单模态基础模型适应多模态任务,而不会干扰特定模态学习和跨模态学习。我们在一系列视觉语言(RefCOCO、RefCOCO+、RefCOCOg)和视听(AVE、AVS)基准测试中评估了 CoLA,其表现始终优于 LORA,分别实现了约 3% 和 2% 的相对增益,同时保持了参数效率。值得注意的是,CoLA 实现了第一个用于视觉基础的多任务 PEFT 框架,弥补了高效多模式适应方面的关键差距。代码可在 https://github.com/peterwisu/CoLA 获取