论文
E2E-GMNER:端到端生成式多模态命名实体识别
E2E-GMNER: End-to-End Generative Grounded Multimodal Named Entity Recognition
摘要
带视觉定位的多模态命名实体识别 (GMNER) 旨在联合识别文本中提及的命名实体,预测其语义类型,并将每个实体定位到关联图像中相应的视觉区域。现有方法主要采用基于管道的架构,将文本实体识别和视觉定位解耦,导致错误累积和次优联合优化。在本文中,我们提出了 E2E-GMNER,这是一个完全端到端的生成框架,它将实体识别、语义打字、视觉定位和隐式知识推理统一在单个多模态 大语言模型 中。我们将 GMNER 制定为指令调整的条件生成任务,并结合思想链推理,使模型能够自适应地确定视觉证据或背景知识何时提供信息,从而减少对噪声线索的依赖。为了进一步解决生成边界框预测的不稳定性,我们引入了高斯风险感知框扰动(GRBP),它用概率扰动的软目标代替硬框监督,以提高针对注释噪声和离散化错误的鲁棒性。 Twitter-GMNER 和 Twitter-FMNERG 基准的大量实验表明,与最先进的方法相比,E2E-GMNER 实现了极具竞争力的性能,验证了统一端到端优化和噪声感知视觉定位监督的有效性。代码位于:https://github.com/Finch-coder/E2E-GMNER