论文

嵌入之前分配:视频嵌入的自适应视觉输入分配

Allocate Before You Embed: Adaptive Visual Input Allocation for Video Embeddings

上下文与知识上下文工程

摘要

大规模视频检索需要嵌入模型在紧张的视觉输入和推理预算下对长且多样化的视频进行编码。现有方法通常以其原始分辨率对一小部分固定的帧进行采样,从而限制了时间覆盖范围并忽略了帧的重要性。我们的实证分析表明,即使在固定的视觉输入预算下,扩大时间覆盖范围也能改善检索。当保留原始的每帧分辨率时,增益会更大,突出了时间覆盖和空间保真度的互补作用。受这一发现的启发,我们提出了 AllocEmbed,这是一种分配然后嵌入的框架,可以在更多帧上重新分配固定的视觉输入预算。轻量级分配器使用低成本预览在嵌入主干之前分配逐帧分辨率,在最有利于检索的地方保留更多细节,同时降低其他地方的视觉成本。我们进一步引入检索驱动的策略优化(RDPO),它使用经过排名验证的相似性差距和置信引导的效率激励直接从检索反馈中学习分配器。 AllocEmbed 完全在主干之前运行,可与现有检索系统集成,无需修改嵌入模型或下游管道。 MMEB-V2 V-QA 和 V-RET 任务以及我们的 LongRet 基准测试表明,AllocEmbed 在评估的预算匹配方法和跨嵌入主干的传输中实现了最佳的整体检索性能。我们的代码可在 https://github.com/jinsong8/AllocEmbed 上公开获取。