论文
ResAdapt:高效多模态推理的自适应分辨率
ResAdapt: Adaptive Resolution for Efficient Multimodal Reasoning
摘要
多模态 大语言模型 (MLLM) 通过缩放输入保真度来实现更强的视觉理解,但由此产生的视觉标记增长使得共同维持高空间分辨率和长时间上下文变得令人望而却步。我们认为,瓶颈不在于编码后表示的压缩方式,而在于编码器接收的像素量,并使用 ResAdapt 来解决这个问题,ResAdapt 是一个输入端适应框架,可了解每个帧在编码前应接收多少视觉预算。 ResAdapt 将轻量级分配器与未更改的 MLLM 主干结合在一起,因此主干保留其本机视觉词元接口,同时接收运算符转换的输入。我们将分配制定为上下文赌博机,并使用成本感知策略优化(CAPO)来训练分配器,它将稀疏的采样轨迹反馈转换为稳定的准确性成本学习信号。在预算控制的视频 QA、时序定位和图像推理任务中,ResAdapt 改进了低预算操作点,并且通常位于或接近效率精度边界,在积极压缩下的推理密集型基准测试中获得最明显的收益。值得注意的是,ResAdapt 在相同的视觉预算下支持多达 16 倍的帧数,同时提供超过 15% 的性能增益。代码可在 https://github.com/Xnhyacinth/ResAdapt 获取。