论文
少看多思考:多模式联合词元计算适应 LLM
Look Less, Think Faster: Joint Token-Compute Adaptation for Multimodal LLMs
摘要
多模态 大语言模型 (MLLM) 最近在视觉语言任务中表现出了强大的性能。然而,由于大量输入视觉标记和 大语言模型 (LLM) 的繁重计算而产生的高推理成本仍然是实际部署的主要障碍。最近的工作试图通过自适应优化各个维度来降低成本,例如修剪冗余的视觉标记或跳过 LLM 层和头。尽管如此,先前的方法通常独立地处理这些维度并忽略了基本的耦合:必须根据输入内容在所有维度上动态分配可用的计算资源。为了弥补这一差距,我们提出了 SmartVL,这是一个统一的自适应推理框架,可以联合控制视觉词元数量和模型计算能力,以响应不同的输入内容和计算预算。 SmartVL 引入了一个视觉端词元控制器,可动态选择信息丰富的视觉词元,以及一个 LLM 端计算控制器,可自适应调整 LLM 计算。重要的是,这些控制器经过训练可以相互协调,以便总体推理成本满足目标预算。为了实现这种联合调度,我们使用共享预算编码连接控制器,并利用可微延迟估计器进行端到端训练。这种设计使 SmartVL 能够学习适应输入复杂性和运行时计算约束的跨阶段分配策略。跨多个 MLLM 基准的实验表明,通过联合调度,SmartVL 始终优于先前的自适应方法,并实现了卓越的精度-效率 Pareto 前沿。项目页面:https://www.schaterji.io/publications/2026/jointtokencompute。