论文
StreamPro:流媒体视频中从反应性感知到主动决策
StreamPro: From Reactive Perception to Proactive Decision-Making in Streaming Video
摘要
主动的流媒体视频理解需要模型持续处理视频流并决定何时响应,而不仅仅是响应什么。这自然会引入部分观察下的决策问题,其中模型必须平衡早期预测与足够的证据。然而,现有的基准在很大程度上遵循“先看后回答”的范式,只有在出现明确的证据后才会触发响应,从而有效地减少了对延迟感知的主动推理。因此,他们无法评估模型在不完整的观察下做出及时、可靠决策的能力。此外,由于流轨迹中的静默信号和响应信号之间的极度不平衡,以及需要共同优化响应正确性和时序,训练主动模型本身就具有挑战性。为了应对这些挑战,我们引入了 StreamPro-Bench,这是一个新的基准,它从三个互补的角度评估流模型:感知理解、时间推理和主动代理,其中最后一个衡量模型在部分观察下做出早期可靠决策的能力。我们进一步提出了 StreamPro,一个用于主动学习的两阶段训练框架。首先,我们引入 CB-Stream Loss 来缓解监督 微调 (SFT) 期间严重的监督不平衡。然后,我们应用组相对策略优化(GRPO)和多粒度奖励设计,涉及回合级和轨迹级奖励。实验表明,StreamPro 显着提高了主动性能。在 StreamPro-Bench 上,它取得了 41.5 的成绩,大大超过了之前的最佳成绩(10.4),同时在实时流媒体基准测试中也保持了强劲的性能,在 StreamingBench-RTVU 上取得了 78.9 的成绩。