论文
重排器看到了什么:面向长文档多模态问答的多方面页面标注
What the Reranker Sees: Multi-Aspect Page Annotation for Long-Document Multimodal Question Answering
摘要
对混合文本、表格、图表和插图的数十到数百页文档进行视觉问答(VQA),通常遵循先检索后阅读的流水线。在我们的设定中,瓶颈从检索召回转移到重排器侧的证据选择:在MMLongBench-Doc上,BGE-M3达到Recall@20 = 0.86但F1@5仅为0.254,即使是视觉检索器ColPali也仅达到F1@5 = 0.332;只看原始片段的纯文本重排LLM即使在上游检索器已编码图像的情况下,也会漏掉表格、图表和版面证据。我们提出Trident,包含两个互补组件:Trident-R,一个与检索器无关的LLM重排器,将每个候选转换为LLM可读的语义记录,包括视觉描述、章节路径、实体标签、多轴概念命中和文本片段,然后执行一次自适应K重排调用;Trident-S,一个生成侧模块,在主题、实体和结构三个视角下提示VLM后再进行综合。在两个长文档数据集上,标注+重排协议在五个异构候选池上大幅提升检索F1,每个重排后的候选池都超过最强的自适应K基线PageIndex。没有标注的LLM重排几乎不改变首个命中排名,表明提升来自结构化标注。Trident-S面向开放式综合问题设计,在这类问题上最多提升6.6个百分点的生成准确率。最佳Trident配置是我们评估中最强的下游QA流水线,两个LLM评判的排名一致(kappa = 0.913)。
