论文

稀疏证据就足够了:用于多模态视频错误信息检测的代理证据寻找

Sparse Evidence Can Suffice: Agentic Evidence Seeking for Multimodal Video Misinformation Detection

智能体系统Agent 架构与控制循环

摘要

多模态视频错误信息检测通常被表述为整体视频理解任务,其中整个视频及其相关内容在一次传递中进行处理和判断。然而,现实世界的错误信息通常表现出稀疏且组合的证据结构:可靠的决策可能仅依赖于一些耦合的线索,而大多数视频内容提供的附加信息有限。因此,详尽的多模态推理可能会引入大量冗余和模糊的决定性证据。这促使证据获取与验证脱钩:首先识别稀疏的、与决策相关的线索,然后根据获取的证据判断准确性。因此,我们提出了 SIEVE,一种在多模态视频错误信息检测中通过提取进行稀疏交互式证据验证的框架。寻求证据的代理积极探索可用的多模式证据并构建一个紧凑的证据包,然后由验证者用来确定准确性。该代理接受有监督的证据寻求轨迹和证据感知强化学习目标的训练,该目标促进信息证据的获取,同时阻止不必要或无效的交互。对多个视频错误信息基准的实验表明,SIEVE 始终优于评估的基准,并支持使用紧凑证据包进行可靠验证。此外,由此产生的采集过程提供了明确且可检查的证据线索,提高了多模式错误信息检测的透明度和基础性。