论文
多模式文档问答的约束主导集
Constrained Dominant Sets for Multimodal Document Question Answering
摘要
长多模态文档问答受到读者到达的证据数量的限制,而不是检索的数量。在冗长的文档中,研究结果经常在图形、标题和介绍性句子中重复出现,导致现代多模态检索增强生成(RAG)系统中基于相似性的 检索器 将资源分配给近似重复项,同时忽略补充证据。这项工作引入了 检索器,它在查询增强亲和力图上选择证据作为约束主导集 (CDS),提供了相似性排名所没有的三个优点。首先,查询被编码为硬结构约束,确保每个选定的元素通过簇锚直接连接到问题。其次,相关性-冗余平衡由频谱范围自动确定,从而消除了多样性感知选择器所需的手动调整权衡的需要。第三,选择过程通过复制动态实现全局平衡,从而避免贪婪启发法引入的扭曲。该方法本质上是基于图的,不需要训练。使用 Qwen3-VL-32B 读取器,CDS 在 VisDoMBench 上建立了新的技术水平(平均 66.99),并在 VisDoMBench 上比无检索基线提高了 37.1点,在 MMLongBench-Doc 上提高了 4.8点。