论文
CIAN:通过检索增强生成实现事件丰富图像描述的多阶段框架
CIAN: Multi-Stage Framework for Event-Enriched Image Captioning via Retrieval-Augmented Generation
摘要
事件丰富的图像描述不仅描述了可见内容,还描述了更广泛的事件背景,包括时间、位置和参与者,而大多数像素绑定模型都缺少这些功能。我们提出了上下文图像文章叙述者(CAN),这是一个多阶段框架,可以用外部叙述丰富字幕。 CIAN 使用 SigLIP 检索相关文章,对其进行总结,以使用经过 LoRA 微调的 Qwen 模型指导叙事生成阶段,并应用基于 N-Gram 的细化来实现流畅性和连贯性。在 OpenEvents-V1 基准测试中,CIAN 实现了较高的检索性能(mAP 0.979)并提高了描述质量,将 CIDEr 从 0.030 提高到 0.094。这些结果凸显了检索增强推理与语言细化相结合生成上下文感知、类人字幕的有效性。