论文
即插即用:使用预训练的对齐模型一目了然地解决多模态共指问题
Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model
摘要
视觉信息有助于解决共指解析中的歧义,从而显着提高性能。然而,现有的多模态共指解析(MCR)方法需要在应用之前使用目标数据集中的(部分)注释数据进行训练,这阻碍了它们的直接可用性并引起了对泛化的担忧。虽然具有数十亿参数的视觉语言大型模型 (VLLM) 提供了有前景的零样本功能,但它们在很大程度上仍然难以访问。它们的庞大规模限制了可部署性,而且许多只能通过付费 API 访问。在本文中,我们提出了一种即插即用的方法,该方法策略性地采用经过仔细预训练的 \emph{alignment model} 以便立即在 MCR 任务中使用,旨在消除对稀缺基准数据集进行训练或依赖于资源密集型 VLLM 的需要。具体来说,我们首先使用视觉语言对齐数据集预训练文本和视觉上下文信息之间的细粒度对齐模型。然后,我们通过将视觉和分类线索与证据理论融合,通过相似性聚合将对齐模型重新调整为 MCR,从而提高有效性。在 Coreference Image Narratives (CIN) 基准数据集上的实验证明了我们方法的有效性,与 SOTA 专用方法和流行的 VLLM 相比,CoNLL F1 分别提高了 5.31% 和 2.12%。我们进一步在掩码 CIN 数据集上评估我们的方法以进行鲁棒性测试,并在专门构建的 VCR-MCR 数据集上进行泛化评估,结果证实了这两种能力。