论文
VTAgent:用于证据感知视频文本的代理关键帧锚定VQA
VTAgent: Agentic Keyframe Anchoring for Evidence-Aware Video TextVQA
摘要
基于视频文本的视觉问答(Video TextVQA)旨在通过对视频中出现的视觉文本内容进行推理来回答问题。尽管最近的 Video-LLM 具有强大的多模态视频理解能力,但它们在现有 Video TextVQA 基准测试上的性能仍然有限。为了更好地理解这一差距,我们通过逐帧问答进行上限分析,如果任何帧产生正确答案,则将样本视为正确,这显着优于直接基于视频的推理,并揭示了巨大的性能差距。结果表明,主要瓶颈在于关键问题相关证据的本地化,而不是推理能力本身。基于这一见解,我们提出了一个问题引导的代理框架,该框架在回答之前明确锚定相关关键帧。该方法在 无需训练 设置中有效运行,并且始终超越直接视频推理。借助额外的监督 微调 (SFT) 和强化学习 (RL),它在基准测试中的准确率平均提高了 +12.12,ANLS 平均提高了 +11.15,建立了新的最先进结果。我们的研究强调了显式关键帧锚定对于推进视频文本 VQA 的关键作用。该代码将公开发布。