论文

CRAFT:针对多模态视频问答的评论家改进的自适应关键帧定位

CRAFT: Critic-Refined Adaptive Key-Frame Targeting for Multimodal Video Question Answering

模型推理推理验证与自校正

摘要

针对现实世界新闻事件的扎根多视频问答要求系统在异构视频档案中显示与查询相关的证据,同时将每个声明归因于其支持来源。我们引入了 CRAFT(评论家改进的自适应关键帧目标),这是一个查询条件管道,它将动态关键帧选择、每个视频 ASR 与多语言后备相结合,以及一个混合评论家循环,用于在合并之前迭代验证和修复声明。该管道集成了 UNLI 时间蕴涵、DeBERTa-v3 交叉声明筛选和 Llama-3.2-3B 裁决器,以及最终的引文合并阶段,该阶段将每个事实与所有支持源标识符一起发出一次。在 MAGMaR 2026 上,CRAFT 取得了最佳的总体平均值 (0.739)、参考召回率 (0.810) 和引文 F1 (0.635)。我们进一步评估了具有 52 个非重叠事件查询的 WikiVideo 的 MAGMaR 式转换,其中 CRAFT 也表现强劲(平均 0.823),表明其以声明为中心的证据聚合泛化到 MAGMaR 之外。消融表明,原子声明、ASR 和批评者循环推动了普通查询条件基线的主要收益。代码和实现细节可在 https://github.com/bhosalems/CRAFT 上公开获取。