论文

ViDR:以源视觉证据为基础的多模式深度研究报告

ViDR: Grounding Multimodal Deep Research Reports in Source Visual Evidence

上下文与知识检索增强

摘要

最近的深度研究系统提高了 大语言模型 通过迭代检索和推理生成长篇、有根据的报告的能力。然而,大多数以文本为中心的系统主要依赖于文本证据,而多模态系统通常只能弱检索图像或自己生成图表,从而导致源数据没有充分用作证据。我们推出 ViDR,这是一个多模式深度研究框架,以源数据为基础的长篇报告。 ViDR 将源数据视为可检索、可解释、可路由和可验证的证据对象,同时仍然在需要时生成分析图表。它构建了一个将主张与文本和视觉证据联系起来的证据索引大纲,通过上下文感知过滤、大纲感知重排序和基于 VLM 的视觉分析将嘈杂的网络图像细化为源图证据原子,并生成具有特定部分证据的每个部分。 ViDR 进一步验证视觉参考,以减少幻觉或错位的图形。我们还推出了 MMR Bench+,这是一个评估深度研究报告中视觉证据使用的基准,涵盖源图检索、放置、解释、可验证性和分析图表生成。实验表明,与强大的商业和开源基线相比,ViDR 提高了整体报告质量、源图集成和可验证性。这些结果表明,源视觉证据对于多模式深度研究非常重要,因为它加强了证据基础、视觉支持和报告可验证性。