论文

一种具有代理控制的高效流媒体视频理解框架

An Efficient Streaming Video Understanding Framework with Agentic Control

模型推理测试时计算扩展

摘要

流视频需要在严格的延迟预算下处理动态信息密度。然而,现有的方法通常采用静态策略,例如固定内存压缩或依赖单个模型,从而强制进行权衡:快速模型在复杂查询上失败,而始终在线的重型模型违反实时约束并使简单查询过于复杂。我们提出 R3-Streaming(记住、响应、推理),而不是预先修复这些决策,它将流视频理解表述为级联控制问题:对于每个查询,系统压缩内存,判断响应准备情况,并按顺序路由计算,以便每个下游决策都建立在逐步细化的信息状态上。为了优化这个管道,我们引入了一种内存压缩的年龄感知遗忘策略,因为积极压缩历史帧可以带来显着的性能提升。对于计算路由,我们提出了 TB-GRPO,这是一种目标平衡的强化学习目标,可将硬查询路由到更强大的模型,同时防止模式崩溃。广泛的评估表明,R3-Streaming 在流式 MLLM 中取得了最先进的结果,在 OVO-Bench 上达到 57.92,在 StreamingBench 上达到 76.36,同时将视觉词元使用量减少了 95% 至 96%。