论文
STRIVE-D:面向复杂查询的自动自动驾驶视频检索与结构化定位
Driving Video Retrieval for Complex Queries with Structured Grounding
摘要
大规模视频检索对于自动驾驶中的数据管理和安全验证至关重要,用户不仅希望找到场景,还希望找到切入和紧急制动等动态事件。现有的视觉语言和基于关键字的检索方法经常会错过这些事件,因为相关的动作可能没有在文本中明确描述或通过词汇重叠捕获。基于规则的检索可以更直视觉定位对此类事件进行编码,但它很脆弱:当生成或手写的规则的假设与真实驾驶数据不匹配时,通常会失败。我们提出了 STRIVE-D,一种用于自动驾驶视频的数据校准检索框架。它使用弱标记的域内视频来估计查询规则何时可靠,调整与观察到的数据不匹配的规则,并将校准的规则分数与视觉语言和基于关键字的检索信号融合。在三个驾驶基准测试中,包括 DrivingDojo 上新发布的人工注释事件数据,与最先进的方法相比,STRIVE-D 的 top-1 准确度相对提高了 84%。