论文
POINTS-Seeker:具有视觉内存管理的多模式搜索代理的开放配方
POINTS-Seeker: An Open Recipe for Multimodal Search Agents with Visual Memory Management
摘要
大型多模态模型 (LMM) 擅长视觉感知,但由于依赖静态参数知识,因此难以处理实时、知识密集型查询。虽然多模态搜索代理提供了一个有前途的解决方案,但从普通的 LMM 开发它们面临着两个主要挑战:缺乏从头开始培养搜索代理的开放方法,以及在长视野多轮调查期间发生的严重上下文爆炸(注意力稀释)。在本文中,我们通过开发本地多模式搜索代理来解决这两个挑战。首先,我们介绍一个以代理播种为特色的开放式训练方案,这是一个形成性训练阶段,可直接从非代理基础上引导工具使用和规划能力。其次,为了克服上下文瓶颈,我们提出了V-Fold,一种自适应内存管理机制。 V-Fold 将最近的交互保留为高保真文本,同时通过渲染将陈旧的历史上下文折叠到视觉空间中,利用模型的跨模式对齐来保留原始证据,而无需文本标记冗余。结合这些创新,我们推出了 POINTS-Seeker-8B,它在六个多模态搜索基准的可比规模模型中实现了最先进的性能。