论文

VTI-CoT:视频推理的视觉文本交错思维链

VTI-CoT: Visual-Textual Interleaved Chain of Thought for Video Reasoning

模型推理推理策略与问题分解

摘要

视频推理旨在理解视频中复杂的时间事件和因果关系。最近,思想链(CoT)被引入该领域以提高推理准确性。然而,现有的基于CoT的视频推理方法主要依靠纯文本信息进行逻辑推导,忽略了推理过程中的关键视觉信息。受人类在推理过程中查看视觉片段的认知机制的启发,我们提出了 VTI-CoT,一种视觉-文本交错的 CoT 框架。 VTI-CoT 将文本推理步骤与相应的视觉框架集成在一起。鉴于现有数据集中视觉文本交错 CoT 的稀缺性,我们开发了一个自动注释管道来构建高质量的多模态 CoT 数据。此外,长视频的推理需要越来越长的 CoT 词元序列,这严重阻碍了训练的收敛性和效率。为了解决这个问题,我们采用基于光学字符识别 (OCR) 的压缩技术将 CoT 监督信号压缩到单个画布中。实验结果表明,VTI-CoT 在相同参数规模的模型中实现了最先进的性能,同时显着提高了训练效率。