论文

MMR-Bench:面向多模态LLM路由的综合基准

MMR-Bench: A Comprehensive Benchmark for Multimodal LLM Routing

模型评测基准与评测资源

摘要

多模态大语言模型(MLLM)发展迅速,但架构、对齐策略和效率方面的异质性意味着没有单一模型在所有任务上都占优。在实际部署中,工作负载从轻量OCR到复杂多模态推理不等;对所有查询使用同一个MLLM,要么在简单实例上过度配置算力,要么在困难实例上牺牲准确率。查询级模型选择(路由)可化解这一矛盾,但将路由从纯文本LLM扩展到MLLM并非易事,原因在于模态融合、各模型计算成本的巨大差异,以及缺乏标准化的预算感知评估。我们提出MMR-Bench,一个隔离多模态路由问题并支持在固定候选集和成本模型下进行比较的统一基准。MMR-Bench提供:(i)带有模态感知输入和可变计算预算的受控环境;(ii)覆盖OCR、通用VQA和多模态数学推理的广泛视觉语言任务套件;(iii)强单模型参考、oracle上界和代表性路由策略。利用MMR-Bench,我们证明引入多模态信号可提升路由质量。实验上,这些线索改善了成本-精度前沿,使路由系统以约33%的成本超过最强单模型的准确率。此外,在部分模型和任务上训练的策略可零样本泛化到新数据集和纯文本基准,无需重新调优,从而确立MMR-Bench作为研究自适应多模态模型选择和高效MLLM部署的基础。代码将发布于:https://github.com/Hunter-Wrynn/MMR-Bench。

MMR-Bench:面向多模态LLM路由的综合基准
图1:MLLM 路由的工作流。它可应用于多种任务,如数学推理、多模态推荐与理解以及医学诊断。