论文

SAKE:带视觉定位的多模态实体识别中自适应利用与探索知识

SAKE: Self-aware Knowledge Exploitation-Exploration for Grounded Multimodal Named Entity Recognition

上下文与知识检索增强

摘要

带视觉定位的多模态命名实体识别(GMNER)旨在提取命名实体并在图像文本对中定位其视觉区域,作为各种下游应用程序的关键功能。在开放世界的社交媒体平台中,由于长尾、快速发展和看不见的实体的普遍存在,GMNER 仍然具有挑战性。为了解决这个问题,现有方法通常依赖于通过启发式检索进行外部知识探索,或者通过多模态 大语言模型 (MLLM) 中的迭代细化进行内部知识开发。然而,启发式检索经常引入噪声或相互矛盾的证据,从而降低已知实体的精度,而仅内部利用则受到 MLLM 知识边界的限制,并且容易产生幻觉。为了解决这个问题,我们提出了 SAKE,一种端到端的代理框架,通过自我意识推理和自适应搜索工具调用来协调内部知识利用和外部知识探索。我们通过两阶段训练范例来实现这一点。首先,我们提出了难度感知搜索标签生成,它通过多次前向采样来量化模型的实体级不确定性,以产生明确的知识差距信号。基于这些信号,我们构建了 SAKE-SeCoT,这是一个高质量的思想链数据集,通过有监督的 微调 为模型配备基本的自我意识和工具使用能力。其次,我们采用具有混合奖励功能的代理强化学习,该功能会惩罚不必要的检索,使模型能够从严格的搜索模仿演变为关于何时真正需要检索的真正的自我意识决策。对两个广泛使用的社交媒体基准的大量实验证明了 SAKE 的有效性。