论文

RA-CoA:通过检索增强属性链进行免训练时尚图像说明

RA-CoA: Training-free Fashion Image Captioning via Retrieval-Augmented Chain-of-Attributes

上下文与知识检索增强

摘要

时尚图像字幕(FIC)在增强电子商务平台的用户体验和产品搜索方面发挥着至关重要的作用。与自然场景图像字幕不同,FIC 需要细粒度的视觉推理和特定领域术语的知识来捕获微妙的属性,例如领口和闭合类型、图形图案和服装轮廓。此外,随着时尚库存随着新趋势、风格和频繁出现的词汇而迅速发展,开发免训练的字幕解决方案对于可扩展性和现实世界的适应性至关重要。指令调整的视觉语言模型 (VLM) 凭借其强大的零样本能力和自然语言流畅性,为时尚图像字幕提供了一种有前景的解决方案。然而,这些通用模型通常缺乏属性级别的覆盖范围和精度,并且往往会产生幻觉或错误识别细粒度的时尚细节,使得它们不太适合产品编目或个性化推荐等高保真应用。为了解决这个问题,我们提出了 RA-CoA(检索增强属性链),这是一种新颖的、免训练的框架,它将时尚图像字幕分解为两个可解释的阶段:(i)从产品知识库中检索相关属性集,以及(ii)属性级推理以生成最终字幕。 RA-CoA 是一种与模型无关的方法,可与冻结的 VLM 配合使用,以提高产品说明中的细粒度属性精度,而无需进行微调。在不同提示范例下对不同 VLM 模型系列进行的广泛评估表明,RA-CoA 显着提高了字幕质量,与零镜头字幕相比,METEOR 分数平均提高了 26.3%。我们公开我们的代码。