论文

StreamOPD:带有时空线索门控的 后训练 配方,用于流媒体视频理解

StreamOPD: A Post-Training Recipe with Spatio-Temporal Cue Gating for Streaming Video Understanding

摘要

流媒体视频理解需要对展开视频的因果观察前缀做出直接响应。现有系统添加了推理时间内存、检索和压缩,但 无需训练 滑动窗口基线已经与它们相匹配。因此,我们修复了一个无内存的最近窗口协议,并询问 后训练 单独可以走多远。具有可验证奖励的强化学习不太适合这种制度,鼓励长时间的“思考然后回答”世代,而 同策略 蒸馏 (OPD) 为学生轨迹提供密集的 词元级 教师监督,但只有当两个模型都在思维模式下训练时才稳定。这些观察导致了 \textsc{StreamOPD},这是一个结合了可验证的流视频数据、思维模式 OPD 和指导模式部署的配方。它将 StreamingBench 从 $77.9\%$ 提高到 $83.9\%$——与 9B 教师相比相差 $0.3$ 点——并且在推理不变的情况下将不包括幻觉检测子任务 (HLD) 的 OVO-Bench 提高了 $9.1$ 点。作为教师权限的扩展,\emph{Spatio-Temporal CueGate (ST-CueGate)} 将提示与无提示的教师似然比聚合成一个重新加权 OPD 的组相对响应分数。它在 OVO-Bench(不包括 HLD)上达到 71.9\%$,在 Video-MME 上达到 64.9\%$,并且是唯一在所有四个基准测试中均高于基本模型的变体。用学生初始策略的冻结副本(同策略 self-蒸馏)取代老师,保留了大部分收益并将 HLD 提升到 $57.0\%$,高于未经训练的学生和 9B 老师,因此弃权损失不是配方固有的。我们为开源流视频研究提供透明且可重复的参考。