论文

ViSMoE:用于体现引用表达基础的视觉感知稀疏专家组合

ViSMoE: Visual-Aware Sparse Mixture-of-Experts for Embodied Referring Expression Grounding

摘要

体现引用表达基础是使代理能够在真实环境中导航并基于自然语言指令本地化远程对象的任务。在这种情况下,代理需要在每一步选择一个视图进行导航,并在目的地的所有候选对象中识别特定对象。然而,以前的大多数方法无法区分视图和对象,而是使用普通视觉编码器来处理它们,这导致视图和对象的表示不明确。为了解决上述问题,我们提出了 ViSMoE,它为稀疏专家混合体配备了针对具体代理的视觉感知路由策略。该框架专门处理不同类型的视觉信息,从而产生视图和对象的有区别的视觉表示。 REVERIE 和 SOON 数据集上的实验结果表明,ViSMoE 优于之前最先进的方法,显示了我们提出的方法的优越性。