论文
Hyper-ICL:使用双曲锚 蒸馏 进行注意力校准,用于多模态上下文学习
Hyper-ICL: Attention Calibration with Hyperbolic Anchor Distillation for Multimodal In-Context Learning
摘要
多模态上下文学习 (ICL) 已成为多模态 大语言模型 的实用推理范例,其中一小组交错的图像文本上下文演示 (ICD) 为模型提供了解决新任务的条件。尽管具有灵活性,但多模态 ICL 会导致较高的推理延迟,并且由于对演示格式、排序和内容的敏感性而导致不稳定。为了解决这些限制,我们提出了 Hyper-ICL,这是一种轻量级、基于训练的免演示多模态 ICL 框架,可直接重建演示效果,而无需在推理时使用 ICD。 Hyper-ICL 学习参数高效的低秩 logits 级适配器,该适配器可校准注意力分布,以更好地匹配演示引起的注意力重新分布。为了捕获示范影响在查询之间的变化,我们引入了一种查询自适应调制机制,该机制可以根据当前查询跨层和头自适应地控制 词元级 的干预强度。最后,我们提出了一种分层双曲锚 蒸馏 损失,它通过洛伦兹测地距离将中间学生特征与演示条件教师对齐。这种损失鼓励学生重建由 ICD 引起的演示-查询关系。跨越六种不同的多模态基准(包括 VQAv2、OK-VQA 和 COCO Caption)的大量实验表明,Hyper-ICL 持续提高了普通 ICL 和现有最先进方法的准确性和稳定性。