论文
视觉世界搜索:持久视觉记忆、分层索引和源头证据
Search over the Visual World: Persistent Visual Memory, Layered Indexes, and Source-Grounded Evidence
摘要
大多数视频检索系统假设有界语料库并返回排名文件或时间戳。通过摄像机、屏幕、流和档案进行操作的代理面临着不同的系统问题:观察不断到达;模型以不同的时间粒度解释它们;必须在不重播完整视觉记录的情况下选择上下文;结果必须与可检查的来源证据保持联系。我们认为,对此类语料库的搜索是一个基础设施问题,不能简化为对视频文件进行排名。我们开发了一个视觉世界搜索的概念和形式模型,该模型建立在分析器定义的场景、持久的理解工件、作为共享源时间上共存场景空间的视觉记忆、以及能力声明索引、区分记忆(保留的所有内容)、上下文(为任务选择的内容)和证据(支撑它的源间隔)的基础上。 VideoDB 数据格式 (VDB) 在生产中实现了此模型,通过涵盖计划检索、状态调查、直接访问和基础合成的类型化搜索界面公开。我们对比了这种与模型无关的基础设施,其中分段、采样、模型选择、嵌入和排名是系统决策,直播流是一流的来源,视频原生基础模型作为固定 API 提供。在与跨越四个公共数据集的 9,800 多个查询的商业视频原生引擎的语义检索比较中,通用组件的管道实现了更高的宏观平均 Recall@1/@3/@10(73.09/83.39/91.20 与 65.75/77.13/89.10),而 Recall@50 的基线更高(96.42 与96.07)。如今,视觉世界的检索质量更多地取决于系统设计,而不是特定于视频的预训练,视觉记忆基础设施可以提供这种质量,同时保持可播放的、基于源的证据一流。