论文
OneStreamer:统一流视频交互中的感知、记忆和主动响应
OneStreamer: Unifying Perception, Memory, and Proactive Response in Streaming Video Interaction
摘要
流媒体视频大语言模型必须在知道其与未来任务的相关性之前保留证据,并在有足够的证据可用时做出回应。面临的挑战是在不影响实时感知的情况下形成可重复使用的事实记忆。我们引入了 OneStreamer,它通过共享的主动生成过程共同学习独立于查询的证据记录和任务响应。其主动分层字幕存储器(PHCM)可生成基于时间的本地细节字幕和已完成事件的摘要。流式字幕目标监督训练期间观察到的视频前缀的解释。在推理时,模型生成的记录补充了最近的视觉窗口,提供可重用的事实上下文,而无需重新访问历史视觉特征。主动状态转换学习(PSTL)通过保留所有输出锚点的监督并选择有代表性的状态变化和状态持久词元来减少重复等待状态的主导地位。我们进一步开发了一个流数据合成管道,将输出内容和时间与可用证据保持一致。将生成的流式字幕和 QA 与清理后的开源数据相结合,生成 OneStreamer-1M,这是一个覆盖范围广泛的流式视频交互数据集,包含超过 100 万条记录,涵盖不同的任务。我们的 4B 模型在所有八个评估的流视频理解基准的比较方法中取得了最佳结果。消融表明,保留生成的字幕可以改善历史质量保证,而不会降低实时感知。 PSTL 的性能也优于密集状态监管,同时仅监管 27.5% 的带注释状态词元。总之,这些结果支持主动生成作为共享学习界面,连接流视频交互中的感知、记忆形成和及时响应。