论文
解耦语义和逻辑:用于视频检索增强生成的 无需训练 从粗到细的管道
Decoupling Semantics and Logic: A Training-Free Coarse-to-Fine Pipeline for Video Retrieval-Augmented Generation
摘要
本文介绍了我们对第二届多模态增强生成研讨会 (MAGMaR) 的系统描述。为了解决跨语言长视频理解、严格人物角色遵守和零幻觉时间基础的关键挑战,我们提出了一个完全 无需训练、两级级联视频 RAG 管道。我们的架构通过模态感知的分工策略性地将语义检索与认知逻辑推理分离。在第一阶段,高召回率语义预取模块仅使用高保真视觉摘要和全局文本描述进行密集检索,显式隔离噪声模态(例如 OCR 和 ASR)以维持原始向量空间。在第二阶段,基于自适应、迭代和推理 (A.I.R.) 的过滤代理由商业 大语言模型 (LLM) 提供支持,执行细粒度的认知重新排序。该代理重新合并完整的多模式上下文,以强制与用户角色严格逻辑对齐,有效地修剪语义相似但逻辑不相关的候选者。最后,提示雕刻机制限制生成器将提取的子集合成为严格格式化的 JSON 响应,并具有精确的块级引用。在 RAG 轨道上进行评估,我们的资源感知方法在信息检索和角色条件生成方面都显示出卓越的精度。