论文

从内容到知识:利用神经知识表示快速理解长视频

From Content to Knowledge: Lightning Fast Long-Video Understanding with Neural Knowledge Representations

摘要

我们通过将长视频视为神经知识表示(NKR),提出了长视频理解的新范式。 NKR 既不是将视频内容表示为词元流,也不是预先组织的数据库,而是将其表示为附加到 VLM 主干的网络权重的一小部分。 NKR 权重经过优化,通过新颖的 Agentic 知识蒸馏 (AKD) 流程封装视频的语义内容,其中代理自动合成密集的描述和问答对,将视频的知识提炼到 NKR 中。虽然 AKD 充当全面的一次性编码阶段,但生成的 NKR 将视频转换为便携式、可重复使用的资产。在推理时,轻量级 NKR 被安装到冻结的视觉语言模型 (VLM) 上,从而实现基于查询的直接理解,而无需重新加载或重新编码原始视频。这种方法将视频长度与推理成本解耦,为多轮视频理解提供高摊余效率。 LVBench 基准测试表明,我们的方法实现了与最先进方法相当的性能,同时将端到端延迟减少了两个数量级以上,为交互式长视频理解开辟了新的可能性。