论文
Omni-DeepSearch:从音频线索出发的全模态深度搜索基准
Omni-DeepSearch: A Benchmark for Audio-Driven Omni-Modal Deep Search
摘要
当前的全模态基准主要评估同时提供多种模态的设置下的模型,而仅从音频开始并主动搜索跨模态证据的能力仍未得到充分探索。在本文中,我们介绍了 \textbf{Omni-DeepSearch},这是音频驱动的全模态深度搜索的基准。给定一个或多个音频剪辑和相关问题,模型必须从音频中推断出有用的线索,调用文本、图像和视频搜索工具,并执行多跳推理以产生简短、客观且可验证的答案。 Omni-DeepSearch 包含 15 个细粒度类别的 640 个样本,涵盖四种检索目标模式和四种音频内容类型。多级过滤管道确保音频依赖性、检索必要性、视觉模态必要性和答案唯一性。对最近闭源和开源全模态模型的实验表明,这项任务仍然极具挑战性:评估最强的模型 Gemini-3-Pro 的平均准确率仅为 43.44%。进一步的分析说明了音频实体推理、查询制定、工具使用可靠性、多跳检索和跨模式验证中的关键瓶颈。这些结果凸显了音频驱动的全模态深度搜索是未来多模态代理的一个重要且尚未充分探索的方向。