论文
守住下限并抬升上限:一种面向多模态搜索智能体的基于合并的范式
Securing the Floor and Raising the Ceiling: A Merging-based Paradigm for Multi-modal Search Agents
摘要
视觉语言模型(VLM)的最新进展推动了多模态搜索智能体的发展,这类智能体能主动调用外部搜索工具并通过多步推理整合检索到的证据。尽管前景可观,现有方法通常依赖大规模监督轨迹或昂贵的强化学习(RL),导致训练成本高、不稳定,且标准 VLM 存在严重的冷启动问题。我们提出一种免训练范式,通过跨模态模型合并赋予 VLM 自主搜索能力。通过把基于文本的搜索智能体与基座 VLM 融合,我们表明无需任何额外多模态训练数据即可有效组合出多模态搜索能力。为减轻跨模态整合中的参数干扰,我们提出 Optimal Brain Merging(OBM),一种显著性感知的合并算法,仅用少量校准样本、依据参数对模型损失的影响识别任务关键参数。在搜索密集型基准(如 InfoSeek、MMSearch)上的大量实验揭示:(1)模型合并作为零样本智能体守住了合理的性能下限,OBM 取得更优的搜索率;(2)OBM 作为热启动策略显著抬升性能上限,比标准 VLM 初始化收敛更快、峰值准确率更高。
