论文

视觉语言模型的渐进式训练策略,以抵消具身推理中的时空幻觉

A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning

模型训练监督微调与指令调优

摘要

视觉语言模型(VLM)在静态图像理解方面取得了重大进展,但在时空推理方面仍然面临关键障碍。主要瓶颈是“多图像推理幻觉”,正向和反向时间查询之间的性能大幅下降揭示了对肤浅捷径的依赖,而不是真正的因果理解。为了缓解这个问题,我们首先开发一个新的思想链(CoT)数据集,将复杂的推理分解为详细的时空步骤和明确的判断。在此基础上,我们提出了一个渐进式训练框架:它首先对 CoT 数据集进行有监督的预训练,以灌输逻辑结构,然后使用可扩展的弱标签数据进行微调,以实现更广泛的泛化。我们的实验表明,这种方法不仅提高了骨干网络的准确性,而且还将前向-后向性能差距从超过 70% 缩小到仅 6.53%。这证实了该方法能够开发真实的动态推理并减少当前 VLM 固有的时间偏差。

视觉语言模型的渐进式训练策略,以抵消具身推理中的时空幻觉
图 1:我们减轻时空幻觉的渐进式训练范例。第 1 阶段(左):CoT 监督的预训练阶段通过监督整个推理链来灌输基础因果推理。第 2 阶段(右):弱监督微调阶段使用大量仅标签数据集扩展了这种能力,展示了正扩展定律。