论文

ReLope:面向多模态LLM路由的KL正则化LoRA探针

ReLope: KL-Regularized LoRA Probes for Multimodal LLM Routing

模型推理测试时计算扩展

摘要

在将轻量模型与强大但昂贵的大模型相结合的大语言模型(LLM)系统中,路由已成为平衡性能与成本的一种有前景的策略。近期研究表明,探针路由(probe routing)——利用小模型的隐藏状态预测其答案正确性——在纯文本LLM中提供了有效方案。然而,我们观察到这些探针在应用于多模态LLM(MLLM)时会显著退化。通过实证分析,我们发现视觉输入的存在削弱了隐藏状态中正确性信号的可分性,使其更难用标准探针设计提取。为应对这一挑战,我们提出两种互补的方法来改进MLLM中的探针路由。首先,我们提出注意力探针(Attention Probe),基于注意力分数聚合前一层的隐藏状态以恢复分布式的正确性信号。其次,我们提出KL正则化LoRA探针(KL-Regularized LoRA Probe, ReLope),插入轻量级LoRA适配器并施加KL正则项以学习路由感知的表示。大量实验表明,我们的方法持续优于基线,说明提升隐藏状态的质量是MLLM有效路由的关键。我们的代码发布于 https://github.com/Spinozaaa/ReLope。

ReLope:面向多模态LLM路由的KL正则化LoRA探针:论文配图
图 1:ReLope 管道。给定输入样本 (𝐱,y)(\mathbf{x},y),MLLM fθf_{\theta} 在层 l−1l-1 产生隐藏状态 𝐙(l−1)\mathbf{Z}^{(l-1)}。将轻量级 LoRA 适配器 θLoRA\theta_{\mathrm{LoRA}} 插入模型中以获得适应的隐藏状态 𝐙~(l)\tilde{\mathbf{Z}}^{(l)}。然后将调整后的最后一个令牌表示 𝐳=𝐳~n(l)\mathbf{z}=\tilde{\mathbf{z}}^{(l)}_{n} 用作路由特征。它被输入探针 gphig_{\phi} 来预测路由的正确性 y^\hat{y}。同时,两个线性头将 𝐳\mathbf{z} 映射到 (,log⁡𝝈2)(\boldsymbol{\mu},\log\boldsymbol{\sigma}^{2}),这参数化了变分瓶颈的高斯后验。训练目标将交叉熵损失与 KL 正则化器相结合,鼓励学习的表示保留与正确性相关的信息,同时过滤掉与任务无关的变化。