论文
HyperEyes:并行多模态搜索代理的双粒度效率感知强化学习
HyperEyes: Dual-Grained Efficiency-Aware Reinforcement Learning for Parallel Multimodal Search Agents
摘要
现有的多模式搜索代理按顺序处理目标实体,为每个实体发出一个工具调用,并在查询分解为独立的子检索时累积冗余交互轮次。我们认为,有效的多模式代理应该搜索更广泛而不是更长的搜索:在一轮内同时调度多个视觉目标定位查询。为此,我们采样轨迹了 HyperEyes,这是一种并行多模态搜索代理,它将视觉基础和检索融合到单个原子操作中,实现跨多个实体的并发搜索,同时将推理效率视为一流的训练目标。 HyperEyes 分两个阶段进行训练。对于冷启动监督,我们开发了一个并行的数据合成管道,涵盖视觉多实体和文本多约束查询,通过渐进拒绝采样策划以效率为导向的轨迹。在此基础上,我们的核心贡献是双粒度效率感知强化学习框架,它在两个层面上运行。在宏观层面,我们提出了TRACE(工具使用参考自适应成本效率),这是一种轨迹级奖励,其参考在训练过程中单调收紧,以抑制多余的工具调用,而不限制真正的多跳搜索。在微观层面上,我们采用 同策略 蒸馏 在失败的采样轨迹时从外部教师注入密集的 词元级 纠正信号,减轻稀疏结果奖励的学分分配缺陷。由于现有基准测试将准确性作为唯一指标来评估,忽略了推理成本,因此我们引入了 IMEB,这是一个由 300 个实例组成的人工基准测试,可联合评估搜索能力和效率。在六项基准测试中,HyperEyes-30B 的准确度比最强的同类开源代理高出 9.9%,工具调用次数平均减少 5.3 倍。