论文
FlowNar:长视频的可扩展流式旁白
FlowNar: Scalable Streaming Narration for Long-Form Videos
摘要
最近的大型多模态模型(LMM)主要为离线设置而设计,不适合流视频的动态要求。虽然最近的在线适应改进了实时处理,但它们仍然面临着关键的可扩展性挑战,资源需求通常至少与视频持续时间呈线性增长。为了克服这个瓶颈,我们提出了 FlowNar,一种用于可扩展流视频旁白的新颖框架。 FlowNar 的核心是用于历史视觉上下文删除的动态上下文管理策略,与我们用于流式视觉历史保留的 CLAM(交叉线性注意记忆)模块相结合,确保有限的视觉内存使用和计算复杂性,这对于高效流式传输至关重要。我们还引入了现实的自调节评估协议和补充评估指标,以评估类似部署条件下的流式叙述模型。在 Ego4D、EgoExo4D 和 EpicKitchens100 数据集上进行的实验表明,FlowNar 在强大的基线上显着提高了旁白质量,同时效率很高,支持处理长 10 倍的视频并实现高 3 倍的吞吐量 (FPS)。代码可在 https://github.com/zeyun-zhong/FlowNar 获取。