论文
RUTA:通过压缩率—效用优化进行有原则的视觉词元分配
RUTA: Principled Visual Token Allocation via Rate-Utility Optimization
摘要
高分辨率图像和长视频为视觉语言模型提供了丰富的上下文,用于多模态推理和细粒度感知,但由此产生的长视觉标记序列使 大语言模型 端计算和内存成本高昂。现有的视觉词元缩减器通常以规定的速率运行,而最近的方法使用特定于方法的学习阈值或重要性预测器来调整跨输入的词元计数。我们引入了 RUTA,一种原则性的速率效用词元分配方法,该方法通过共同学习要保留哪些词元以及分配给每个图像查询对的词元来执行 LLM 之前的缩减。 RUTA 构建查询条件候选标记并预测每个候选标记的保留概率。在训练期间,这些概率参数化独立的伯努利门,而它们的总和提供了每对词元计数的可微训练时间估计。保留的标记充当锚点,根据语义亲和性和空间接近度聚合来自非保留标记的信息。 RUTA 通过带惩罚项的压缩率—效用目标进行优化,平衡下游任务损失与预期词元使用。对五个基准进行平均并相对于每个骨干网的完整词元基线进行测量,RUTA 仅使用 $2.0\%$ 和 $4.2\%$ 的视觉词元,同时在 LLaVA-NeXT-7B 和 Qwen3-VL-8B 上分别保留 $88.2\%$ 和 $94.4\%$ 的任务性能。