论文

MARDoc:用于多模式长文档 QA 的内存感知细化代理框架

MARDoc: A Memory-Aware Refinement Agent Framework for Multimodal Long Document QA

上下文与知识上下文工程

摘要

迭代检索推理代理最近显示出多模式长文档问答的前景。然而,大多数现有系统维护一个单一的增长上下文,混合了检索跟踪、观察和中间推理。随着交互的积累,关键证据变得分散和稀释,使得多跳推理变得嘈杂。我们提出了 MARDoc,一种记忆感知细化代理框架,它将长文档 QA 解耦为三个专门的代理:用于多粒度多模式检索的 Explorer、用于将交互痕迹提炼为结构化证据和推理记忆的 Refiner,以及用于检查证据充分性并提供有针对性的反馈的 Reflector。在迭代过程中,代理依赖于动态更新的结构化内存,而不是完整累积的交互历史记录。这种设计减少了上下文噪音,同时保留了答案关键事实及其逻辑依赖性。 MMLongBench-Doc 和 DocBench 上的实验表明,MARDoc 取得了出色的结果,优于相同主干基线,并证明了结构化内存对于代理文档 QA 的有效性。