论文

以最小费用流组装长多模态文档的问答证据

Min-Cost Flow Routing for Evidence Assembly in Long Multimodal Documents

上下文与知识上下文工程

摘要

长多模态文档问答需要把固定证据预算分配给文本、表格、图示与幻灯片中的相关方面,同时避免近重复证据。FlowReader在多模态内容图上把证据选择建模为带容量限制的最小费用流问题。谱分解识别与查询相关内容的潜在方面,按谱能量比例分配预算;容量限制在路由过程中确保方面覆盖,无需额外调用语言模型进行规划。查询相关的费用设计优先选择相互一致的相关证据链。最优流分解得到短证据链,由视觉语言模型并行阅读,再由推理模型综合。使用Qwen3-VL-32B时,VisDoMBench宏平均准确率为68.9,比最强先前系统高2.7个百分点,在五个子集中领先三个,并获得最高的最差子集准确率。每次查询实际平均使用17.5个内容节点,将数量降至12.9时仍保持领先。固定图、评分器、阅读器与评判器的消融显示,费用设计决定准确率;容量限制在保持准确率的同时,阅读器词元量约为同一网络上无容量限制最短路径路由的四分之三。谱分解识别的方面与LLM生成子问题对应,但无需规划调用。