论文

LaViD:从纯语言教师向视觉模型迁移细粒度概念知识

Large Language Model Teaches Visual Students: Cross-Modality Transfer of Fine-Grained Conceptual Knowledge

摘要

大语言模型从文本预训练中获得丰富概念知识,但如何监督其他模态模型仍未充分研究。LaViD将高层语义知识从纯语言教师迁移给纯视觉学生。方法不依赖多模态配对数据,而是提示LLM生成区分视觉类别语义差异的选择题,将每个类别映射为这些题目上的软标签分布,形成概念特征,并通过辅助蒸馏损失指导学生。尽管教师无法访问图像,LaViD在多个细粒度基准上优于从视觉语言模型蒸馏的MaKD等方法,达到或超过DKD、MLKD等视觉蒸馏方法,结合logit标准化后进一步改善。Waterbirds上的最差群体准确率明显提高,显示其对伪相关的鲁棒性。代码:https://github.com/lliangthomas/lavid。