论文

ViTexQA:用于视频文本问答的多帧时间感知数据集

ViTexQA: A Multi-Frame Temporal Perception Dataset for Video Text Question Answering

模型评测基准与评测资源

摘要

尽管在多模态理解方面取得了显着进展,但当前的 MLLM 在视频文本理解方面仍然表现出局限性,特别是当语义通过跨多个帧的时间分布文本线索的集成而出现时。这种感知挑战从根本上不同于静态图像文本理解,但现有数据集无法捕获:绝大多数问题仍然可以从单帧中回答,不足以反映现实世界的视频文本理解需求。为了解决这个问题,我们提出了 ViTexQA(一个大规模视频文本 QA 数据集)和用于鲁棒多帧时间推理的 FrameThinker。我们通过受时间约束增强的质量控制思想链(CoT)注释管道构建 ViTexQA;它的所有 QA 对都需要跨框架文本融合来解决,从而实现真正的时间依赖性。 FrameThinker 采用两阶段训练进行显式时间建模:CoT 引导的监督 微调 (SFT) 生成帧感知推理链,然后是通过多帧一致性奖励优化的基于时间的强化学习 (RL)。评估显示我们的方法优于 ViTexQA 上的 SOTA 基线,将 ROUGE-L 提升了 6.3%。