论文
IoU-PD:IoU 感知特权 蒸馏,用于多模态 大语言模型 的视觉视觉定位
IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models
摘要
多模态 大语言模型 的视觉基础通常被表述为自回归坐标生成,其中模型将边界框坐标输出为给定图像和引用表达式提示的文本。虽然这个接口很简单并且与指令遵循兼容,但它引入了训练和评估之间的不匹配:训练优化了坐标字符串上的 词元级 可能性,而视觉定位质量是通过几何重叠来测量的。我们提出了 IoU-PD,一种用于坐标生成多模态 大语言模型 的 IoU 感知特权 蒸馏 方法。 IoU-PD 使用 真值 框不仅作为坐标目标,而且还作为特权训练时指导。在训练过程中,学生收到原始图像和提示,而冻结的教师收到带有框标记的图像和指示标记区域的增强提示。学生接受受监督的 微调 锚点和特权 蒸馏 损失的训练,其词元权重反映了几何重要性和教师可靠性。在推理时,IoU-PD 不需要框覆盖、特权提示、教师分支或额外的预测模块。标准引用表达基础基准的实验表明,与强大的坐标生成基线相比,区域级别得到了一致的改进,这表明 真值 框除了用作坐标标签之外,还可以提供有用的特权指导。项目页面:https://xyzzzh.github.io/IoU-PD/