VLMaxxing 通过 FrameMogging 无需训练 针对视频视觉语言模型进行反重新计算
VLMaxxing through FrameMogging Training-Free Anti-Recomputation for Video Vision-Language Models
摘要
视频视觉语言模型(VLM)继续为视觉状态付费,流已经告诉我们是稳定的。工厂墙没有移动,但大多数 VLM 管道仍然为模型提供密集的 RGB 帧或再次提供新的前缀。我们将这种浪费研究为 无需训练 反重新计算:当验证表明状态存在时重用状态,并在场景、查询或缓存拓扑需要时购买新的证据。最大的测量胜利是在摄入之后。在冻结的 Qwen2.5-VL-7B-Instruct-4bit 上,自适应相同视频后续重用可保留 93 查询 VideoMME 宽度设置上的配对选择和正确性,同时将后续延迟减少 14.90-35.92 倍。第一个查询还是冷的;当后面的问题重复使用相同的视频状态时,胜利就开始了。压力测试限制了结果:重复问题的时间表持续 50 个回合,而密集答案锚定的提示变化将保守的固定 K=1 修复与更快的激进漂移策略区分开来。新鲜视频修剪较小但真实。在生成第一个答案之前,C-VISION 会跳过定时视觉塔工作。在 Gemma 4-E4B-4bit 上,干净的 32f 短单元达到 1.316 倍的首次查询加速,在 20 个项目上没有配对漂移或解析失败; Qwen 显示保真度/速度边界。阶段份额上限 (C-CEILING) 是会计护栏:组件加速变成端到端加速仅与它加速的挂钟份额成正比,因此 C-VISION 和摄取后的后续重用不会成倍增加。候选 C-STREAM 仍然是本地率目标,而不是这里的标题结果。更广泛的方向是 VLM 原生媒体,它直接暴露变化、运动、不确定性、对象状态、传感器时间和活动图块,因此模型不必从每一帧的密集 RGB 中重新发现世界。