论文
SVFSearch:面向游戏垂直领域短视频帧搜索的多模态知识密集型基准
SVFSearch: A Multimodal Knowledge-Intensive Benchmark for Short-Video Frame Search in the Gaming Vertical Domain
摘要
多模态大语言模型正越来越多地被用作智能体骨干,以理解多模态输入、规划检索动作、调用外部工具并对检索到的信息进行推理。然而,现有基准很少在短视频应用中评估这种能力,而在短视频中暂停帧往往在视觉上存在歧义,回答需要垂直、长尾且快速演化的领域知识。我们推出SVFSearch,首个面向中文游戏领域短视频帧搜索的开放基准。SVFSearch包含5,000个四选一测试样本和4,198个辅助训练样本,每个样本都以真实短视频片段中的一帧暂停游戏场景为核心。为支持公平且可复现的评估,SVFSearch提供冻结的离线检索环境,包含游戏领域文本语料库、主题关联图像库,以及文本、图像和多模态检索接口,避免依赖不受控的网页搜索API。我们评估了从直接问答、RAG工作流到Plan-Act-Replan智能体和学习型搜索模型等多种代表性范式。结果揭示了仅靠模型作答、实用智能体检索与理想知识之间存在巨大差距:最佳开源直接问答模型达到66.4%,最佳实用智能体达到79.1%,而理想知识可达95.4%。进一步分析暴露了视觉定位、检索质量、基于证据的推理和工具使用行为方面的瓶颈,包括过度搜索、只看答案走捷径以及检索引入的误导。
