论文

InterLV-Search:交错多模式代理搜索基准测试

InterLV-Search: Benchmarking Interleaved Multimodal Agentic Search

模型评测基准与评测资源

摘要

多模式代理搜索的现有基准评估多模式搜索和视觉浏览,但视觉证据要么仅限于输入,要么被视为答案端点,而不是交错搜索轨迹的一部分。我们引入了 \textbf{InterLV-Search},这是交错语言视觉代理搜索的基准,其中文本和视觉证据被重复使用来调节以后的搜索。它包含三个级别的 2,061 个示例:主动视觉证据寻求、受控离线交错多模态搜索和开放网络交错多模态搜索。除了现有的基准之外,它还包括多模式多分支样本,涉及证据搜索过程中多个实体之间的比较。我们使用自动化管道构建 1 级和 2 级,使用机器主导、人工监督的开放网络管道构建 3 级。我们进一步提供 InterLV-Agent,用于标准化工具使用、轨迹记录和评估。对专有和开源多模态代理的实验表明,当前系统距离解决交错多模态搜索还很远,最佳模型的总体准确率低于 50%,凸显了视觉证据寻求、搜索控制和多模态证据集成方面的挑战。我们在 https://github.com/hbhalpha/InterLV-Search-Bench 发布了基准数据和评估代码