论文
用于多模式思维链推理的视觉显着性引导 蒸馏
Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning
摘要
多模态思维链 (CoT) 推理通过逐步推理整合视觉和文本线索。在 词元预算 有限的小型模型中,模态交互融合通常会抑制微小的跨模态差异。特别是,当不同图像与相同文本配对或不同文本与相同图像配对时,多模态 CoT 常常会遇到困难,使得此类输入在融合后几乎无法区分。本研究提出视觉显着性引导 蒸馏 (VSSD)。 VSSD 利用多模态 大语言模型 的注意力图来生成捕获任务敏感特征方向的扰动图像,然后应用奇异值分解来提取主导转向向量以引导层间 蒸馏。 ScienceQA 和 M$^3$CoT 上的实验表明,VSSD 改进了基本原理生成和答案推理。该代码可从 https://github.com/BGWH123/VSSD 获取。