论文
H-OPD:置信度感知异构多教师多模式 同策略 蒸馏
H-OPD: Confidence Aware Heterogeneous Multi-Teacher Multimodal On-policy Distillation
摘要
同策略 蒸馏 (OPD) 最近通过对学生生成的轨迹提供监督而成为一种有效的 后训练 范例。然而,现有的多模态推理 OPD 方法通常依赖于静态教师路由,根据模态或任务类型将每个样本分配给单个教师。这忽略了视觉定位和抽象推理可能主导不同的解码步骤,使得单个教师不足以完成完整的轨迹。为此,提出了 H-OPD 作为一种用于多模态推理的置信感知异构多教师 OPD 框架。通过验证同一推理过程中异质教师的互补性,H-OPD 将任务或样本级教师路由替换为 词元级 沿着共享学生轨迹的教师仲裁。 H-OPD 采用视觉到语言描述传输,使纯文本教师能够访问关键的视觉语义,并使用置信感知仲裁机制在每个标记处动态组合视觉语言教师和纯文本教师。对 11 个广泛使用的推理基准的广泛评估展示了我们方法的卓越性能。