论文

回答之前请先观看:从基于视觉的 后训练 中学习

Watch Before You Answer: Learning from Visually Grounded Post-Training

模型训练合成数据

摘要

对于视觉语言模型 (VLM) 来说,全面理解视觉、时间和文本线索至关重要。然而,尽管多模态建模取得了快速进展,视频理解性能仍然落后于基于文本的推理。在这项工作中,我们发现进展比之前假设的还要糟糕:通常报告的长视频理解基准包含 40-60% 的问题,可以仅使用文本提示来回答。此外,我们发现这些问题在广泛使用的 后训练 数据集中也普遍存在,可能削弱 后训练 提高 VLM 视频理解性能的能力。在这一观察的指导下,我们引入了 VidGround 作为一个简单而有效的解决方案:仅使用实际的视觉基础问题,没有任何语言偏见的 后训练。当与基于 RL 的 后训练 算法结合使用时,这种简单的技术相对于使用完整数据集将性能提高了 6.2 个百分点,而仅使用了原始 后训练 数据的 69.1%。此外,我们表明使用简单的 后训练 算法进行数据管理优于几种更复杂的 后训练 技术,这强调了数据质量是提高 VLM 中视频理解的主要瓶颈。这些结果强调了整理 后训练 数据和评估基准的重要性,这些数据和评估基准确实需要视觉基础来推动功能更强大的 VLM 的开发。项目页面:http://vidground.etuagi.com。