论文
基于知识的新闻图像描述的分层多模态检索
Hierarchical Multi-Modal Retrieval for Knowledge-Grounded News Image Captioning
摘要
传统的图像描述方法通常很难生成全面的、上下文丰富的描述,尤其是对于无法从视觉线索直接观察到的细节。为了克服这个问题,我们提出了一种新颖的检索增强图像描述框架,该框架通过利用外部知识生成具有更深入见解的字幕,例如对象属性、事件上下文和潜在意义。我们的方法具有分层多模式文章检索机制,超越了单一文本实体。该检索考虑文章结构感知特征,包括加权文本成分(例如标题、正文部分)和视觉放置模式,以及多方面的相似性计算(内容-视觉、视觉-视觉和话语定位)。随后的上下文相关性细化阶段进一步增强检索到的信息。然后,检索到的文章作为标题生成的知识库:首先,VLM 生成简洁的图像描述;其次,我们根据此描述从检索到的文章中分割相关信息;最后,LLM 利用描述和提取的知识来生成全面的、上下文详细的标题。我们参加了 ACM Multimedia EVENTA 2025 Challenge,并在 OpenEvent-V1 数据集的私有测试集上以 0.2824 的总分获得第五名。源代码公开发布于 https://github.com/mf0212/EVENTA-Challange。