论文

迈向长期代理多模式搜索

Towards Long-horizon Agentic Multimodal Search

智能体系统Agent 架构与控制循环

摘要

多模式深度搜索代理在通过迭代收集文本和视觉证据来解决复杂任务方面表现出了巨大的潜力。然而,长期管理与多模式输入相关的异构信息和高词元成本仍然是一个严峻的挑战,因为现有方法经常遭受上下文爆炸或关键视觉信号丢失的困扰。为了解决这个问题,我们提出了一种新颖的长程多模态深度搜索框架,名为 LMM-Searcher,以基于文件的视觉表示机制为中心。通过将视觉资产卸载到外部文件系统并将它们映射到轻量级文本标识符(UID),我们的方法减轻了上下文开销,同时保留了多模式信息以供将来访问。我们为代理配备了定制的获取图像工具,从而实现了渐进式、按需视觉加载策略,以实现主动感知。此外,我们引入了一种数据合成管道,旨在生成需要复杂的跨模式多跳推理的查询。使用该管道,我们提取了 12K 高质量轨迹,将 Qwen3-VL-Thinking-30A3B 微调为专门的多模态深度搜索代理。跨越四个基准的大量实验表明,我们的方法成功扩展到 100 轮搜索范围,在具有挑战性的长范围基准(如 MM-BrowseComp 和 MMSearch-Plus)上实现了开源模型中最先进的性能,同时在不同的基础模型中也表现出了强大的通用性。我们的代码将在 https://github.com/RUCAIBox/LMM-Searcher 中发布。