论文
LatentRouter:能在看到答案之前就选对多模态模型吗?
LatentRouter: Can We Choose the Right Multimodal Model Before Seeing Its Answer?
摘要
多模态大语言模型(MLLM)在OCR、图表理解、空间推理、视觉问答、成本与延迟等方面各有优劣。因此,有效的MLLM路由不能只靠估计查询难度:路由器必须将当前图像-问题输入的多模态需求与每个候选模型的能力相匹配。我们提出LatentRouter,一种将MLLM路由形式化为反事实多模态效用预测的路由器。给定一个图像-问题查询,LatentRouter提取学习到的多模态路由胶囊(capsule),用模型能力token表示每个候选MLLM,并在这些状态之间执行潜在通信,以估计每个模型若被选中会有何种表现。分布式结果头预测模型特定的反事实质量,同时有界的胶囊校正在不使残差信号主导预测的前提下修正接近的决策。由此得到的基于效用的策略支持面向性能以及性能-成本权衡的路由,并通过带可用性掩码的共享逐模型评分来应对候选模型池的变化。在MMR-Bench和VL-RouterBench上的实验表明,LatentRouter优于固定模型、特征级以及学习型路由器基线。进一步分析表明,增益在模型选择取决于视觉、布局敏感或推理导向需求的多模态任务组上最强,且潜在通信是改进的主要贡献者。代码发布于:https://github.com/LabRAI/LatentRouter。
