论文
概念驱动领域适应:大海捞针
Concept Driven Domain Adaptation: Finding an Abstract Needle in a Haystack
摘要
科学教师经常不是通过描述屏幕上出现的内容来搜索文献摘录,而是通过询问他们打算教授的抽象概念。该用例暴露了现有基于语言的视频时刻检索方法的局限性,该方法通常假设查询描述可观察的事件,而教学搜索需要检索实例化基础科学原理的具体视觉现象。我们将这种设置作为概念到示例的视频检索来研究,这是一个抽象的大海捞针问题,其中紧凑的课程概念必须基于时间稀疏的文献证据。为了弥补这一抽象差距,我们提出了概念驱动领域适应(CDDA),这是一个三阶段框架,用于将两塔视觉语言模型适应概念级检索。 CDDA 将概念视为中间语义锚:它首先用教科书和教师手册示例概念对构建文本嵌入空间,然后将这种概念感知几何图形转移到冻结视觉编码器下的纪录片视觉效果,最后通过稀疏视觉概念监督联合调整两个编码器。从几何角度来看,这种分阶段对齐减少了文本概念和视觉概念的角度间隙,从而鼓励概念级适应,同时保留预训练模型的具体图像描述对齐。在精心策划的中学物理检索基准上,CDDA 比几个竞争性多模态基线(包括 Qwen3-VL-Embedding-2B)实现了更强的面向教学的概念检索,同时在适应后保持具体的图像文本匹配。