论文

LiveStarPro:利用分层内存实现长视野流的主动流视频理解

LiveStarPro: Proactive Streaming Video Understanding with Hierarchical Memory for Long-Horizon Streams

摘要

尽管Video 大语言模型(Video-LLM)取得了显着的进步,但当前的在线架构仍然难以同时处理连续视频流、自主决定何时响应以及保留长期上下文记忆。这些障碍会破坏实时响应能力,并在长时间的交互过程中导致严重的遗忘。在这项工作中,我们介绍了 LiveStarPro,这是一种实时流媒体助手,旨在用于对长视界流进行主动视频理解。 LiveStarPro 的设计基于三个互补的组件。第一个组件是流验证解码(SVeD),这是一个推理框架,通过单遍困惑度验证来识别适当的响应时序,从而消除对显式沉默词元的依赖。第二个组成部分是流因果注意力掩模(SCAM),这是一种在可变长度流上强制执行增量视频语言对齐的训练策略。第三个组件是树结构分层内存(TSHM),这是一种递归内存架构,它将逐出的历史信息组织到事件链中,从而能够从有效无界的视频流中进行有效检索。为了便于在真实的在线条件下进行全面评估,我们进一步推出了 OmniStarPro,这是一个跨越 15 个不同现实场景的大规模基准,并扩展到小时尺度的流,以评估长期召回率。大量实验表明,LiveStarPro 始终超越现有方法,语义正确性提高了 28.9%,计时错误降低了 18.2%,而其流式键值缓存与没有缓存的相同模型相比,推理速度进一步提高了 1.58 倍。该模型和代码可在 https://github.com/sotayang/LiveStarPro 上公开获取。