论文
通过多步嵌入检索学习在视觉空间中进行路由
Learning to Route in Visual Space via Multi-Step Embedding Retrieval
摘要
LLM Agent依赖检索工具来访问外部知识,但视觉 Agentic 搜索仍然受到标准单步检索器的严重瓶颈。在当前的管道中,Agent必须为每个中间步骤发出文本查询,当视觉线索难以描述或检索器无法在其顶级结果中显示必要的中间证据时,Agent就会陷入困境。我们假设将整个嵌入空间的多步导航直接卸载到检索工具可以解决这个性能瓶颈。为了系统地研究这个问题,我们引入了 VHOP,一种灵活的数据生成框架和基准测试,具有五个核心难度级别,可测试视觉匹配和搜索规划。使用这个框架,我们开发了 VHOP-Router,这是一个端到端的训练管道——结合了监督微调、在线模仿学习和强化学习——将标准嵌入模型转换为自回归多步检索器。 VHOP-Router 直接在视觉潜空间中运行,在单个工具调用中检索链接的图像链,而不需要Agent制定中间文本查询。实验表明,VHOP-Router 将检索性能从不到 5\% 提高到 76.3\%。在 Agentic 搜索中,任务成功率从 1886 提高了 52.7%,平均词元长度减少了 61% 到 728,而升级Agent仅带来了 3.7% 的增益。与Agent每步检索前 50 个结果的强大基线相比,VHOP-Router 保持了卓越的性能,同时将上下文图像减少了 $23\times$,并将累积 API 负载减少了 $35\times$。这些模型还可以稳健地推广到看不见的难度级别和现实的测试集。最终,VHOP 和 VHOP-Router 为可视化 Agentic 搜索提供了高效且有效的解决方案,使本地 LLM 功能完好无损。