论文

多模态语言模型需要多少视觉标记?使用 F^3A 扩展视觉标记修剪

How Many Visual Tokens Do Multimodal Language Models Need? Scaling Visual Token Pruning with F^3A

上下文与知识上下文工程

摘要

视觉语言模型通过将越来越长的视觉标记序列输入到语言主干中来改善感知,但由此产生的推理成本提出了一个基本的扩展问题:随着多模态模型的增长,实际需要多少视觉标记,以及在固定视觉 词元预算 下应如何分配它们?现有的 无需训练 修剪方法通常通过一次性代理来回答这个问题,例如解码器注意力、视觉相似性或条件多样性。我们认为,视觉标记修剪最好被视为任务条件证据搜索,特别是在积极压缩和跨模型规模的情况下。我们提出了 F^3A,一个用于视觉标记修剪的 无需训练 路由器,它在语言模型消耗图像标记之前运行。 F^3A 构建轻量级问题条件线索,通过冻结的稀疏传感头将它们与视觉网格标记进行匹配,并通过粗略证据定位、局部细化、覆盖保持竞争和覆盖不足区域的恢复来分配固定视觉 词元预算。它不需要 模型训练,不需要额外的 LLM 前向传递,并保留原始的多模态提示和解码管道。