论文

GeoTrace:视频的几何感知轨迹词元压缩 大语言模型

GeoTrace: Geometry-Aware Trajectory Token Compression for Video Large Language Models

模型推理推理加速

摘要

尽管Video 大语言模型(Video LLM)在视频理解方面表现出了很强的性能,但其效率仍然受到大量视觉标记的限制。现有的视频词元压缩方法通常依赖于逐帧显着性或启发式词元合并,这可能会过度关注局部显着区域并产生模糊的融合特征。为了解决这些问题,我们提出了 GeoTrace,这是一种 无需训练 时空词元压缩框架,可将视频证据分解为精确的骨架词元和可追踪的残留事件词元。具体来说,上下文最远点锚定(CFPA)保留了显着的、上下文一致的和高覆盖率的骨架词元,而轨迹约束残余压缩(TCRC)通过一对一的时间轨迹和约束的近流形压缩来压缩残余词元,从而产生具有减少模糊性的可追踪事件词元。我们在四个视频理解基准的四个视频 LLM 上评估了 GeoTrace,结果证明了其在不同模型架构和场景中的有效性和泛化性。在 LLaVA-OneVision 上,仅保留 10\% 的视觉标记,GeoTrace 实现了 \(12.99\times\) TFLOPs 减少,同时保留了 99.1\% 的普通性能。总体而言,GeoTrace 提供了紧凑且可追踪的词元表示,以实现高效且强大的视频 LLM 推理。代码可在 \href{https://github.com/guohuan-xie/GeoTrace.git}{\texttt{Code}} 获取。