论文

您的视频模型的记忆力如何?测量长视频理解中的内存预算权衡

How Well Can Your Video Model Remember? Measuring Memory-Budget Trade-offs in Long Video Understanding

模型评测评测方法与指标

摘要

我们引入了一个紧凑的经验模型,该模型量化了长视频理解中答案准确性如何随着帧预算 B 和时间距离 D 的变化而降低——使用总帧的分数 B 回忆过去 D 秒的内容时分析性能。长篇模型在严格的预算下运行,但之前没有任何框架可以预测随着 B 的缩小和事件的消退,准确性会如何降低。我们对十个模型和三种采样策略的约 155,000 个二元预测拟合了加权最小二乘模型,得出了一个定律,其中 logits 精度在对数预算中线性缩放,距离相关指数随距离对数线性衰减。该预算指数 α(D) 捕获距离 D 处额外帧的边际值。该定律实现了跨模型的单元级加权 R^2 = 0.05-0.75。值得注意的是,在 D = 1000 秒时,最佳流媒体模型和基本模型之间的预算效率相差约 7.4 倍。 STREAMINGVLM 达到 α(1000) = 1.26 (95% CI: [1.06, 1.58]),这意味着十倍的预算增加大大提高了长距离精度,而最好的 Qwen3-VL 基础模型仅达到 α(1000) = 0.17 (CI: [0.04, 0.34])。在精度空间中,D = 1000 秒时预算增加 10 倍,STREAMINGVLM 的预算增加了 29 个百分点,而基本模型则增加了 4 个百分点。采样策略显示了模型相关的权衡:随机采样产生更高的基本灵敏度,但距离衰减更陡。我们演示了 α(D) 如何实现有原则的预算分配,包括远距离模型排名逆转,并建议将其作为流视频模型的诊断指标。