论文
DV-SFT:用于细粒度视觉理解的直接视觉监督
DV-SFT: Direct Vision Supervision for Fine-Grained Visual Understanding
摘要
多模态 大语言模型 通常经过端到端训练来预测 真值 答案,但监督信号仅应用于文本标记。视觉标记是视觉信息的核心载体,仅作为上下文的一部分进行隐式优化,从而导致粗粒度的视觉理解。先前的工作试图监督视觉输入,但不可避免地依赖辅助组件,例如额外的解码器或前向传递,因为视觉标记缺乏易于解释的标签。这限制了它们的实际应用。在这项工作中,我们提出 \textbf{D}irect \textbf{V}ision \textbf{S}supervised \textbf{F}ine-\textbf{T}uning (DV-SFT),它为视觉标记构建显式的 词元级 监督,并通过用于文本的相同下一个标记预测目标来训练它们。具体来说,我们利用 OCR 相关场景中的直接视觉-文本对应关系,并使用相应图像块中的单词自动标记每个视觉标记。 DV-SFT 将 MLLM 视为黑匣子,不需要架构修改或额外的前向传递。大量的实验证明了直接视觉监督的优越性。 DV-SFT 在三个域内和四个域外基准测试中始终优于标准 SFT。进一步分析表明,视觉监督有效增强了细粒度的视觉理解,实现了更高的多模态对齐效率。