论文

从路由信号到选择性审查:MoE VLM 中的视觉重grounding

From Routing Signals to Selective Review: Visual regrounding in MoE VLMs

模型推理推理验证与自校正

摘要

视觉语言模型 (VLM) 可以接受错误的视觉前提,回答有关目标对象的颜色、计数、位置或状态的问题,即使目标对象不存在。我们将这种可靠性关键行为称为目标缺失grounding故障。现有的视觉grounding检测器主要依赖于生成的响应、隐藏状态或不确定性测量。我们提出了第一个框架,利用混合专家 (MoE) VLM 中的内部路由决策来在生成之前检测目标缺失并指导选择性校正。我们从 Qwen3-VL-30B-A3B-Instruct 和 Gemma-4-26B-A4B-it 中提取目标词元路由概率,为每个模型训练一个单独的 L2 正则化线性检测器,并使用其预测有选择地调用目标感知审阅提示。仅使用路由,Qwen 和 Gemma 检测器在 GQA-Inpaint 上实现了 0.9988 和 0.9956 的 ROC-AUC,并在外部 OBER 数据集上分别保留了 0.8095 和 0.7781。由此产生的路由门控策略在不修改模型权重的情况下,将 GQA-Inpaint 和 OBER 的端到端准确率提高了 22.25%,Qwen 提高了 22.25% 和 12.17%,Gemma 提高了 13.42% 和 1.39%。进一步的分析表明,信号定位于目标对象词元,出现在早期的 MoE 层中,并分布在部分可替代的专家中。尽管跨数据集阈值变化需要重新校准,但假阳性审查造成的总体危害有限,这表明可以通过联合选择检测器阈值和审查提示来控制干预风险。总体而言,我们表明,仅路由概率就可以保留有关视觉感知的可操作信息,从而允许 MoE VLM 已生成的计算支持低成本检测和选择性视觉重新定位。