论文

AdaKerNet:使用多模态大型模型进行任务自适应预测的神经核解码

AdaKerNet: Neural Kernel Decoding for Task-Adaptive Prediction with Multimodal Large Models

模型训练参数高效训练

摘要

大型基础模型的引入有望有效适应下游任务。然而,在有限的监督下,MLLM 作为一类重要的大型基础模型,在适应各种下游任务方面仍然具有挑战性。适应通常依赖于 MLLM 参数微调或训练基于神经的解码器。这两种方法都在有限的监督下挣扎,而微调还需要访问模型参数,而闭源模型通常无法获得这些参数。我们介绍 AdaKerNet,一种新颖的可学习任务自适应神经内核解码器。 AdaKerNet 完全不知道底层 MLLM 的参数,并且仅根据从各种可用模式获得的(冻结的)丰富表示进行操作。 AdaKerNet 依赖于 (i) 一组可学习、Lipschitz 控制的多模态特征,这些特征源自这些 MLLM 表示; (ii) 提供这些特征的软结构先验的参考内核; (iii) 一个轻量级非线性神经预测器,可以自适应地使该结构变形。在统一的优化框架内联合学习内核表示和神经预测器使 AdaKerNet 能够捕获与下游任务相关的特征和几何关系。四个 MLLM 的数值测试:BLIP-2、LLaVA-1.5、Qwen2.5-VL 和 Gemini Embedding 2,以及涵盖文本、音频、图像和表格测量的多模态输入,表明在一系列稀缺标签预算中,相对于直接 MLP、注意力、自动编码器和基于内核的解码器,有显着且一致的改进,跨基线的平均误差降低高达 41%。这些结果使 AdaKerNet 成为一种在稀缺标签体系中根据冻结多模态表示进行预测的有效方法。其他结构消融突出了 AdaKerNet 组件的互补贡献。