论文
StreamScout:学习何时深入了解流媒体视频
StreamScout: Learning When to Look Deeper for Streaming Video Understanding
摘要
流视频理解需要回答在无限视频流中任意时刻出现的问题。现有系统主要关注在有限内存中保留什么,但对每个查询使用相同的固定成本过程来访问该内存,尽管所需的证据存在很大差异。我们认为,决定每个查询访问内存的深度与决定内存应该存储什么同样重要。为此,我们引入了 StreamScout,这是一个自适应推理框架,当流展开时,它仅在上下文中维护轻量级文本时间线。在查询时,StreamScout 会通过最多三个信息量越来越大的视觉视图逐步增强时间线:查看最近的帧、统一回顾过去的流以及查询显着检索。在每个阶段,如果现有证据足够,模型会立即给出答案;否则,它将升级到下一个视图。为了改进这种停止或升级策略,我们在辅助集上探测级联,并将模型的经验能力边界提炼为轻量级 LoRA 适应的监督,从而产生 StreamScout-S。我们通过强化学习进一步完善策略,使模型能够探索超越模仿精炼决策的停止行为,从而产生 StreamScout-R。在三个主干网和三个流基准测试中,StreamScout 及其变体始终优于以前的流方法,同时大幅降低推理成本和词元消耗;例如,在 OVO-Bench 上,StreamScout-S 将 Qwen3-VL-8B 提高了 14.65 个点,同时使用的标记比均匀采样少 59%,平均在 1.04 秒内完成回答。