论文
ReLope:面向多模态LLM路由的KL正则化LoRA探针
ReLope: KL-Regularized LoRA Probes for Multimodal LLM Routing
摘要
在将轻量模型与强大但昂贵的大模型相结合的大语言模型(LLM)系统中,路由已成为平衡性能与成本的一种有前景的策略。近期研究表明,探针路由(probe routing)——利用小模型的隐藏状态预测其答案正确性——在纯文本LLM中提供了有效方案。然而,我们观察到这些探针在应用于多模态LLM(MLLM)时会显著退化。通过实证分析,我们发现视觉输入的存在削弱了隐藏状态中正确性信号的可分性,使其更难用标准探针设计提取。为应对这一挑战,我们提出两种互补的方法来改进MLLM中的探针路由。首先,我们提出注意力探针(Attention Probe),基于注意力分数聚合前一层的隐藏状态以恢复分布式的正确性信号。其次,我们提出KL正则化LoRA探针(KL-Regularized LoRA Probe, ReLope),插入轻量级LoRA适配器并施加KL正则项以学习路由感知的表示。大量实验表明,我们的方法持续优于基线,说明提升隐藏状态的质量是MLLM有效路由的关键。我们的代码发布于 https://github.com/Spinozaaa/ReLope。
