论文
用于长上下文文档问答的能力路由视觉检索和证据线程
Capability-Routed Visual Retrieval and Evidence Threading for Long-Context Document Question Answering
摘要
年度报告、尽职调查包和信息图表仪表板将数字隐藏在页面图像中:轴、单元网格和脚注,OCR 管道将其扁平化,页面级视觉检索器仍将其视为可互换的上下文示例。我们保留冻结的 Qwen2.5-VL-7B-Instruct 生成器和 ColPali / VisRAG-Ret 页面索引,并插入三个模块。能力感知视觉路由器 (CAVR) 将每个检索到的页面标记为文本、表格、图表、布局或混合,并在生成之前混合专家。弱到强页面选择 (WSPS) 将冻结的 7B 责任教师提炼为 3B 选择头,因此排名不再是单一的 InfoNCE 分数。视觉证据线程 (VET) 构建长度最多为 3 的布局锚定路径,并让生成器读取线程而不是平坦的 top-$k$ 列表。在 DocVQA / ChartQA / InfographicVQA 黄金页面上,7B 系统达到 96.3 / 90.1 / 85.4。在 VisRAG top-3 协议下,对于具有级联的相同主干网,平均生成精度为 62.74,而平均生成精度为 59.39。在 MMLongBench-Doc 检索然后阅读上,F1 从 19.2 移动到 22.6,多页精度从 16.4 移动到 21.2。 WSPS 重新排名后的 ViDoRe nDCG@5 为 83.6,TAT-DQA 财务报告为 70.4。