论文

Argus:查询感知区域MoE增强视觉文档检索

Argus-Retriever: Vision-LLM Late-Interaction Retrieval with Region-Aware Query-Conditioned MoE for Visual Document Retrieval

摘要

后期交互视觉语言 检索器 将每个文档页面表示为许多视觉标记嵌入,并使用 MaxSim 为查询评分。在 ColPali、ColQwen、ColNomic 和 Nemotron ColEmbed 等系统中,文档嵌入是在不查看查询的情况下生成的,因此对于表查找、图表问题和布局敏感的证据请求,同一页面的表示方式相同。我们引入 \textbf{Argus},这是一个基于 Qwen3.5-VL 构建的查询条件后期交互 检索器 系列。 Argus 添加了一个区域感知混合专家模块:查询编码器生成检索嵌入和紧凑上下文向量,文档页面被汇集到空间区域中,查询感知路由器在 MaxSim 之前为每个区域选择潜在专家。输出仍然是与 ColPali 样式检索兼容的多向量索引,但文档表示现在依赖于查询(即 $\mathbf{D}(q)$)。与最近最先进系统的 2560 维和 4096 维头相比,所有 Argus 模型都使用 1024 维检索头,并且在大约 9% 的可用公共监督而不是整个池上进行训练。 9B 模型在 ViDoRe V1 上达到 \textbf{92.67} NDCG@5,在组合 V1+V2 排行榜上达到 \textbf{86.0} NDCG@5,这是组合排行榜上开放后期交互模型的最高报告值。 Argus-9B 封装在 ViDoRe V3 上的 Qwen3.6-27B 代理检索管道中,在公共任务上进一步将其 NDCG@10 从 60.28 提高到 \textbf{64.80},这表明相同的 检索器 既可以作为强大的独立系统,也可以作为迭代 LLM 代理的搜索原语。