论文
SearchEyes:经搜索世界模拟迈向前沿多模态深度搜索智能
SearchEyes: Towards Frontier Multimodal Deep Search Intelligence via Search World Simulation
摘要
训练多模态搜索智能体执行多跳推理仍具挑战,根源是结构性断裂:既有管线独立构建训练数据、搜索环境与奖励信号——导致合成的结构化元数据被丢弃、环境依赖不可复现的外部引擎、RL奖励停留在轨迹级稀疏。我们提出SearchEyes:以类型化知识图为骨架的“模拟搜索世界”——统一三者。我们提出感知—知识链(PKC):在Wikidata5M的视觉—知识交集上采样受约束的多跳路径,保留跳级实体元数据——同时定义自包含的搜索世界与步级奖励锚。进一步提出跳锚定策略优化(HaPO):复用这些锚做步级信用分配,无需单独训练的过程奖励模型。六个多模态知识密集基准上的实验显示:SearchEyes在开源多模态搜索智能体中取得最先进表现——SearchEyes-27B较最强开源基线平均提升6.2分。
