论文

何时检索,何时保留:流媒体视频大语言模型的不确定性感知时间证据分配

When to Retrieve, When to Stay: Uncertainty-Aware Temporal Evidence Allocation for Streaming Video-LLMs

上下文与知识上下文工程

摘要

流视频理解需要视频大语言模型 (Video-LLM) 在因果约束下对连续视觉流进行推理。随着视觉历史的增长,有限的视觉处理预算需要证据选择来平衡时间新近度和查询相关性。仅最近选择排除了潜在相关的历史证据,而当相关性分数不明确时,仅语义检索可以取代有用的最近上下文。我们引入了 WRWS(何时检索,何时停留),这是一种用于不确定性自适应证据分配的免训练框架。轻量级外部视觉语言编码器对观察到的历史记录中的查询相关性进行评分,而自适应分配模块使用相似性分布的归一化熵作为检索不确定性的代理。当相关性线索可靠时,WRWS 有利于语义检索,并在不确定性下加强新近度先验。按照先检索、后编码的流程,WRWS 在目标模型视觉编码之前选择证据,这样昂贵的目标 Video-LLM 才会处理选定的观察结果。四个 Video-LLM 系列和多个模型规模的实验证明了 StreamingBench 和 OVO-Bench 上具有竞争力的准确性。在我们的效率评估中,WRWS 将平均视觉到答案时间缩短至最先进方法的 47.93%。代码将被发布。