论文
TraVEL:用于驾驶视频检索的轨迹引导视频嵌入学习
TraVEL: Trajectory-Guided Video Embedding Learning for Driving-Video Retrieval
摘要
从大规模驾驶日志中有效检索相关片段对于数据管理、模型开发和安全分析至关重要。结构化和基于规则的检索系统可以明确地针对驾驶事件,但通常需要专家定义的规则、辅助数据和多级感知管道。多模态嵌入模型通过用单个可搜索向量表示每个视频,提供了一种更简单、更有效的替代方案。然而,通用模型通常依赖于静态场景上下文的快捷方式,并且难以区分以运动为中心的事件,例如左转与右转或加速与减速。在这项工作中,我们研究如何将通用多模态嵌入模型应用于驾驶视频检索。我们首先使用 InfoNCE 目标在配对剪辑和 nuReasoning 的推理轨迹上微调 Qwen3-VL-Embedding。虽然这个阶段大大改善了整体检索,但仅靠字幕监督仍然不足以实现细粒度的运动理解。因此,我们引入了 TraVEL(轨迹引导视频嵌入学习),这是一种运动感知 微调 框架,它使用自我轨迹相似性作为组相对策略优化中的奖励。轨迹仅作为特权训练监督;检索仍然在单向量视频嵌入上运行,没有自我姿势、专家规则或辅助感知输出。我们进一步构建了 nuReasoning 的驾驶视频检索基准。实验表明,TraVEL 改进了跨模型尺度的以运动为中心的检索:相对于 SFT,它在 2B 处将纵向和横向 mAP 提高了 9.8 点和 4.7 点,在 8B 处相应增益为 7.2 点和 1.5 点。因此,TraVEL 将物理基础监督与高效的基于嵌入的搜索结合起来。