论文
专家无需训练就能适应吗? MVLM 中的测试时模态泛化
Can Experts Adapt Without Training? On Test-Time Modality Generalization in MVLMs
摘要
医学视觉语言模型 (MVLM) 承诺广泛的零样本泛化,但当遇到看不见的模式和领域时,它们的可靠性就会崩溃,而这正是临床鲁棒性最重要的地方。为了解决这个差距,我们从专家混合(MoE)的角度重新审视测试时模态泛化,并问:专家是否可以在推理过程中进行路由和调整而不进行任何优化?我们在测试时发现了一个基本的专业化-泛化困境,即盲目地聚集模态专家会稀释模态特定的知识,而选择一位高度自信的专家则可能会导致转移时的不匹配风险。为了解决这个问题,我们提出了 MoBE:一个完全无需优化的框架,可以在测试时执行动态专家选择和适应。 MoBE 将 MoE 设置中的熵引导动态路由与专家明智的贝叶斯自适应相结合,使专家能够更新他们的置信度并在线适应,而无需梯度更新。在没有参数更新的情况下,MoBE 通过测试时路由和在线统计增强了静态 MVLM,在可见、不可见和异构医疗基准中,与最先进的 TTA 方法相比,平均准确度增益提高了 +4.72、+7.17 和 +4.3,突出了 无需训练 专家适应对于稳健模态泛化的有效性。