论文

KiToke:基于内核的视频间隔感知词元压缩 大语言模型

KiToke: Kernel-based Interval-aware Token Compression for Video Large Language Models

上下文与知识上下文工程

摘要

Video 大语言模型(Video LLM)在视频理解任务上取得了很强的性能,但由于大量的视觉标记而导致推理成本很高。我们提出 KiToke,一种 无需训练 与查询无关的词元压缩方法,可以减少时空冗余,同时保留关键的视觉信息。我们的方法使用基于内核的冗余度量来估计全局词元多样性,从而实现在极端 词元预算 下仍然有效的内容自适应选择,并进一步引入了具有间隔感知词元合并的轻量级时间间隔构造以保持时间一致性。与依赖本地或分段级启发式的先前方法不同,KiToke 显式捕获整个视频中的全局冗余,从而提高词元利用率。对多个视频理解基准和视频 LLM 主干的大量实验表明,KiToke 的性能始终优于现有的 无需训练 压缩方法,在保留率低至 1% 的情况下,收益特别大。