论文
ExpArt-KG:通过知识图的迭代探索生成艺术品图像描述
ExpArt-KG: Artwork Image Description Generation through Iterative Exploration of Knowledge Graphs
摘要
大视觉语言模型(LVLM)在基于图像的文本生成和视觉问答方面取得了强大的性能。然而,他们仍然难以全面、准确地描述与图像中所描绘的对象相关的实体和概念之间的事实关系。在这项工作中,我们提出了一个框架,通过检索增强生成(RAG)有效地利用知识图中的事实信息,目标是使 LVLM 能够生成详细且准确的图像解释。具体来说,我们的方法在答案生成和知识图检索之间交替,并使用正确性判断来控制搜索,从而有效地获取必要且充分的事实信息。我们还构建了艺术品领域的知识图(ExpArt-KG),其中图像和实体之间的对应关系是明确的。将所提出的方法应用于该知识图谱,我们通过实验证明,它提高了艺术品解释的详细程度并降低了外部知识的检索成本,同时保持了与迭代固定次数相当的生成质量。