论文

ChronoVision:通过潜在状态重建进行时间推理

ChronoVision: Temporal Reasoning via Latent State Reconstruction

模型训练强化学习

摘要

多模态 大语言模型 擅长被动感知,但难以处理需要多步骤时间推理的复杂视觉认知任务。这种退化很大程度上源于基于语言的推理固有的模糊性,它通常无法准确地表达连续的视觉转换。为了解决这个问题,我们提出了 ChronoVision,这是一个多模态框架,旨在使视觉逻辑与潜在图像保持一致。在监督 微调 期间,重建视觉头预测最终转换状态的潜在表示,而 ROI 注意力定位模块通过语义跨度查询将模型集中在关键视觉证据上。在 后训练 中,我们应用具有隐式过程基础机制的强化学习,以评估结果正确性、潜在过程对齐和无监督视觉焦点的复合奖励函数为指导。此外,我们还引入了 Vbvr-VQA,这是一种新颖的数据集,它通过将视频推理重新表述为严格的图像排序任务来评估时间跟踪。实验表明,ChronoVision 在 Vbvr-VQA 上实现了最先进的性能,域内准确率为 74.8%,域外准确率为 71.6%,而 IntPhys2(一项极具挑战性的跨域基准测试)的准确率高达 55.0%。