论文
视觉语言模型的渐进式训练策略,以抵消具身推理中的时空幻觉
A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning
摘要
视觉语言模型(VLM)在静态图像理解方面取得了重大进展,但在时空推理方面仍然面临关键障碍。主要瓶颈是“多图像推理幻觉”,正向和反向时间查询之间的性能大幅下降揭示了对肤浅捷径的依赖,而不是真正的因果理解。为了缓解这个问题,我们首先开发一个新的思想链(CoT)数据集,将复杂的推理分解为详细的时空步骤和明确的判断。在此基础上,我们提出了一个渐进式训练框架:它首先对 CoT 数据集进行有监督的预训练,以灌输逻辑结构,然后使用可扩展的弱标签数据进行微调,以实现更广泛的泛化。我们的实验表明,这种方法不仅提高了骨干网络的准确性,而且还将前向-后向性能差距从超过 70% 缩小到仅 6.53%。这证实了该方法能够开发真实的动态推理并减少当前 VLM 固有的时间偏差。
