论文

同策略 蒸馏 用于视觉语言模型自适应,低质量多模态数据的有效范例

On-Policy Distillation for Vision-Language Model Adaptation, an Effective Paradigm on Low-Quality Multimodal Data

摘要

知识蒸馏 提供了一种将适应任务的视觉语言教师转移到紧凑型学生的有效途径。当前视觉语言 蒸馏 方法中的训练目标通常是根据教师预测构建的,并统一应用于所有训练样本,这使得它在类别和领域转换下不可靠。在本文中,我们认为 蒸馏 目标构建应被视为动态训练决策而不是固定配方。为此,我们提出了 OnPoKD,一个用于视觉语言模型自适应的 同策略 蒸馏 框架。据我们所知,OnPoKD 是第一个通过学习目标构建作为策略决策,将 同策略 蒸馏 应用于视觉语言模型自适应的框架。 OnPoKD 学习一个轻量级控制器,该控制器使用来自教师模型、学生模型和零样本先验的可靠性和分歧线索构建样本自适应目标。控制器不依赖固定的教师预测,而是通过有界策略操作动态平衡教师监督、零样本先验指导和硬标签锚定,从而使 蒸馏 目标能够适应不同的样本可靠性和训练阶段。策略控制器根据验证反馈进行更新,鼓励目标构建以优化可转移性,而不仅仅是拟合训练分布。由于控制器仅在训练期间使用,因此 OnPoKD 可以无缝集成到现有视觉语言 蒸馏 管道中,同时保留原始推理架构和测试时间成本。对基础到小说的泛化和跨数据集传输基准的大量实验表明,OnPoKD 始终优于强大的视觉语言 蒸馏 基线。