论文
通过查询感知流潜在推理增强长视频VLM嵌入
Enhancing Long-Video VLM Embeddings with Query-Aware Streaming Latent Reasoning
摘要
长视频嵌入需要在有限的视觉token预算下捕获稀疏的查询相关证据。均匀采样可能会错过跨越几分钟或几小时的视频中的简短事件,而在单个上下文中编码更多帧会增加记忆和计算量。我们引入了 查询感知流式潜在推理 (QASLR),这是一个后训练框架,它可以跨剪辑积累证据,同时保持嵌入大小固定。 QASLR 选择一组有界的帧,恢复它们的时间顺序,并使用视觉语言骨干模型逐个剪辑地处理它们。一组紧凑的持久性思考token交叉关注每个剪辑的功能,而嵌入的token在每次更新后读出标准化表示。此设计集成了多个骨干模型调用的证据,而不要求所有选定的框架共享单个上下文。 训练结合了最终对比学习、逐步对比监督和最终嵌入自蒸馏。中间监督训练部分视频读出进行检索,而自蒸馏将它们规范化为最终表示。查询感知选择为候选集评分和重新排名生成查询条件表示,而查询独立选择则支持可重用的语料库索引。在完整的训练配方下,2B 和 8B Qwen3-VL-Embedding 骨干模型的 HourVideo 检索 Hit@1 分别从 54.2 增加到 70.7,从 57.4 增加到 72.8。增益扩展到评估的时刻检索和视频 QA 任务,并且流媒体头传输到嵌入骨干模型的第二个 Qwen 系列。这些结果支持流式潜在聚合作为将长视频证据集成到固定维度表示中的有效方法。
