论文
LiteSearch-VL:通过轨迹蒸馏和合成逐步DPO构建小型多模态搜索智能体
LiteSearch-VL: Small Multimodal Search Agents via Trajectory Distillation and Synthetic Step-DPO
摘要
多模态搜索代理通过交织图像理解、网络检索、工具使用和证据合成来回答视觉问题。强大的系统是存在的,但存在两种昂贵的机制:专有的前沿模型,如 GPT-5 和 Gemini,或者使用大量代理数据和强化学习训练的大型开放视觉语言主干。我们提出一个不同的问题:当在单节点预算下将发布的代理轨迹提炼成更小的骨干网时,实际传输的是什么?我们使用 LiteSearch-VL 来研究这一问题,这是 Qwen3-VL-2B 和 Qwen3-VL-4B 的低计算配方,仅使用已发布的 OpenSearch-VL 轨迹、参数高效的 LoRA 适配器和合成步骤级首选项:GPT-5 上的 DPO 生成的硬底片针对五种局部故障模式(过早回答、错误工具、弱查询、重复查询、忽略图像)。在 SimpleVQA、FVQA、LiveVQA 和 VDR-Bench-testmini 上进行的 12,400 次 GPT-5 判断的部署中,主要效果是行为而不是统一的精度提升:全轨迹监督微调转移了代理合约,使 2B 模型从几乎从不发出可用答案(1,237/1,240 no_answer 部署)到 28.4% 的宏 Pass@1,匹配或略高于现成的 4B 基料 (25.6%)。综合偏好学习和紧凑工具蒸馏充当细化而不是相变(最佳 4B 配置:30.8% 宏 Pass@1)。最后,受控的 VDR 逐步预算消融表明,额外的搜索会将弃权转化为错误的实体错误而不是正确的答案,从而确定答案验证而不是搜索深度,作为小型多模态代理的下一个瓶颈。
