论文

TAP-RAG:长文档多模态问答的任务感知策略控制

TAP-RAG: Task-Aware Policy Control for Long-Document Multimodal Question Answering

上下文与知识检索增强

摘要

长文档多模式问答需要的不仅仅是从大型文档中检索相关块。不同的查询需要不同的证据行为。现有的多模式 RAG 系统通过文本块、页面图像、图形链接或异构文档元素来改进证据访问,但它们通常应用很大程度上与查询无关的证据使用策略。我们提出了 TAP-RAG,一种用于长文档多模式 QA 的任务感知策略控制 RAG 框架。 TAP-RAG 包含一个主控制器、任务感知策略控制器(TAPC)和两个策略引导证据执行器:任务感知查询引导流扩散(TA-QFD)和任务感知视觉增强(TAVE)。对于每个查询,TAPC 都会先预测任务,估计视觉/局部/全局证据信号,并生成可执行策略。然后,TA-QFD 在多模式文档图上扩展文本和结构证据,而 TAVE 在需要视觉或布局证据时选择性地检查页面图像。受保护的综合阶段融合文本、视觉和结构证据,并在支持不足时放弃。在 DocBench 和 MMLongBench-Doc 上,TAP-RAG 在比较系统中实现了最佳的整体精度,比匹配的多模态 RAG 基线分别提高了 +9.1 点(61.1 至 70.2)和 +4.5 点(42.2 至 46.7)。