论文

EGSD:用于流视频理解的基于事件的自蒸馏

EGSD: Event-Grounded Self-Distillation for Streaming Video Understanding

摘要

实时视频理解需要增量地维护流内容的内存,而优化它需要密集的过程信号。on-policy自蒸馏(OPSD)可以提供这样的词元级信号,它让一个模型既充当教师又充当学生,教师接收额外的特权信息,例如问题和真实情况(GT)答案。然而,将其直接应用于流媒体视频会带来两个问题。 (1) 学生无法进行端到端优化,记忆是在问题到达之前写入的,但老师却以问题和 GT 特权对其进行评分,从而偏离了他们的偏好。 (2)有效实体记忆崩溃,问题和GT特权使教师只偏爱与问题相关的实体,而对记忆的标记均值使其信号对于记忆覆盖的实体数量不变,两者都驱动记忆对抗多样性的流式需求。为了解决这些问题,我们提出了基于事件的自蒸馏(EGSD),它将流内存描述为对可验证事件(关键视觉实体、动作和细节)的增量更新,并在此基础上针对这两个问题。对于问题(1),我们将 OPSD 信号调整为与结果奖励相结合的乘法权重;对于问题(2),我们将事件作为特权信息重新赋予教师权重,以抵消其问题相关性偏差,并添加实体覆盖奖励来提供词元均值教师所缺乏的覆盖偏好。对主流线上线下基准的大量实验表明,EGSD 表现强劲,在 StreamingBench 上达到 79.8%,在 OVO-Bench Real-Time 赛道上达到 73.4%,而内存分析显示,仅增加 6.8% 的内存长度,有效实体召回率就提升了 17.4%。