论文

TRACE:证据基础引导的多视频事件理解和声明生成

TRACE: Evidence Grounding-Guided Multi-Video Event Understanding and Claim Generation

上下文与知识上下文工程

摘要

多视频事件理解需要能够定位和归因分散在长的异构视频语料库中的与查询相关的证据的模型。现有的大型视觉语言模型(LVLM)在这种情况下通常表现不佳,因为它们很快就会耗尽上下文预算,并且难以精确定位明显重要的片段,经常丢失密集的信息线索,例如广播图形、字幕和记分板。我们引入了 TRACE,这是一种证据基础指导框架,遵循多视频事件推理的先于推理策略。我们的方法首先使用 OCR 和对象检测为每个视频构建一个结构化的、可文本搜索的时间线。然后,纯文本 LLM 进行查询感知证据本地化,在任何下游视觉推理之前选择相关时刻。检索到的帧及其基础摘要随后用于指导基于 LVLM 的声明生成和跨视频引文整合。 MAGMaR 2026 和 WikiVideo 上的实验表明,结构化基础显着提高了事实完整性和归因保真度。在 MAGMaR 验证分割中,与无引导的 Qwen3-VL-30B 基线相比,TRACE 将宏观平均 MiRAGE F1 从 0.705 提高到 0.811,尤其是引文召回率从 0.440 提高到 0.628。该方法还在官方 MAGMaR 2026 排行榜上取得了最先进的结果。代码发布于https://github.com/pengyu965/TRACE。