论文
双流语义引导与原型锚定校准,实现视觉语言模型的完全无源自适应
Dual-Stream Semantic Guidance with Prototype Anchor Calibration for Source-Fully-Free Adaptation of Vision-Language Models
摘要
完全自由的源域适应 (SFF-DA) 已成为一种战略范例,无需访问源数据或特定于任务的源模型即可适应视觉语言模型 (VLM)。然而,我们发现了阻碍这一过程的关键双重语义漂移:固定类嵌入的刚性引起的静态漂移,以及生成的标题的分歧引起的动态漂移,导致严重的语义错位,加剧了稳定性-可塑性困境。为了解决这个问题,我们提出了 DSSG(双流语义指导),这是一种端到端框架,可以协调细粒度可塑性与全局稳定性。我们的核心贡献是双重语义指导(DSG)模块,它将特定领域知识的标题流与类锚定流集成在一起,以锚定全局分类一致性。此外,引入了动态跨模态 知识蒸馏 (CMKD) 模块,以利用不断发展的教师分布来校准师生一致性。在 DSSG 的基础上,我们进一步引入了原型锚点校准(PAC),产生了 DSSG-PAC,它定期校准原型锚点并缓存它们,直到下一次校准。这种设计减少了冗余的文本端计算,同时保留了课堂指导对不断发展的文本空间的适应性。我们进一步建立了 SFF-DA 风险界限,将学生风险与语义教师质量和师生差异联系起来。大量实验表明,DSSG 在多个基准测试中始终优于当前最先进的方法,而 DSSG-PAC 在很大程度上保留了其适应性能,总适应时间缩短了 18.9%。该代码可从 https://github.com/mrmenand/DSSG 获取。