论文
BAS-OPD:预算敏感的选择性同策略自蒸馏,用于细粒度的多模态感知
BAS-OPD: Budget-Aware Selective On-Policy Self-Distillation for Fine-Grained Multimodal Perception
摘要
多模态大语言模型(MLLM)在处理完整图像时常常难以实现细粒度的视觉感知,因为关键证据可能只出现在局部区域。策略自蒸馏 (OPD) 能够将特权视觉知识从信息视图转移到全图像策略,但每条采样轨迹都都向教师询问会带来大量的监督成本。在这项工作中,我们提出了 BAS-OPD,一种预算感知的选择性 OPD 框架,可在有限的查询预算下分配教师监督。 BAS-OPD 不是查询所有采样轨迹,而是选择信息丰富的样本,同时保持全批次的学生生成。我们探索随机、基于不确定性和基于学习效用的选择策略,其中学习选择器根据已停止梯度传播的轨迹统计量和源自学生与教师的一致性和教师信心的在线效用信号来估计查询值,而无需额外的学生前向传递。 BAS-OPD 仅改变训练时间监督分配并保留单通道全图像推理。细粒度多模态感知基准的实验表明,BAS-OPD 取得了强劲的性能,同时大幅降低了教师的监督成本,凸显了选择性 OPD 在预算有限的情况下的有效性。