论文

通过自我监督指导促进视觉指令调整

Boosting Visual Instruction Tuning with Self-Supervised Guidance

模型训练监督微调与指令调优

摘要

多模态 大语言模型 (MLLM) 在许多视觉语言任务上表现良好,但常常难以解决需要细粒度视觉推理的以视觉为中心的问题。最近的证据表明,这种限制不是由弱视觉表示引起的,而是由指令调整过程中视觉信息的利用不足引起的,其中许多任务可以仅使用语言先验来部分解决。我们提出了一种简单而轻量级的方法,通过少量以自然语言指令表示的基于视觉的自我监督任务来增强视觉指令调整。通过将旋转预测、颜色匹配和跨视图对应等经典的自监督借口任务重新表述为图像-指令-响应三元组,我们引入了不依赖视觉证据就无法解决的监督。我们的方法不需要人工注释,不需要架构修改,也不需要额外的训练阶段。在多个模型、训练制度和基准中,仅注入一小部分(3-10%)此类基于视觉的指令即可持续提高以视觉为中心的评估的性能。我们的研究结果强调,使用基于视觉的 SSL 任务进行指令调整是通过对训练数据分布进行简单调整来改进 MLLM 视觉推理的强大杠杆。代码位于:https://github.com/sirkosophia/V-GIFT