论文
选择、压缩、再投资:长视频 MLLM 中视觉词元分配的对照研究
Select, Compress, Reinvest: A Controlled Study of Visual-Token Allocation in Long-Video MLLMs
摘要
长视频语言模型无法查看每一帧:一小时每秒采样一次是 3,600 张图像,而系统仅保留该池中的一小部分固定部分。哪些帧在该切片中幸存下来通常被视为预处理细节;我们测试是否应该如此。已发布的选择器使比较变得困难,因为它们同时更改了帧评分器、提示边界、解决策略和回答模型。我们一次保留每个固定和变化的决定:选择、空间压缩和节省的再投资,涉及六个 无需训练 选择规则、三个长视频基准测试和两个回答模型。选择是最大的单一杠杆:在 LongVideoBench 的长达一小时的 bin 上,八个查询选择的帧比 16 个均匀间隔的帧高出 6.9 个点,而正交匹配追踪(Orthogonal Matching Pursuit)是一种未经修改的数十年历史的稀疏近似算法,在所有三个基准测试中,与我们比较的每个专用选择器都匹配或在一个点内。压缩接近于免费:以固定时间戳将每帧的空间预算减半最多花费 0.44 个点。再投资是预算回归准确性的地方:将释放的词元花费在两倍的压缩帧上,测量成本不高于原始的八个点,再返回两到三个点;只有当节省下来的资金以这种方式使用时,压缩才会产生回报。在此过程中,我们自己的 AKS 基线中的一个实现错误以及在相同预算下运行相同已发布规则的两个工具之间存在 0.07 到 3.74 点的差距,这说明了为什么这些比较需要在一个受控工具内进行,而不是跨论文进行。