论文

ReflectCAP:利用反思记忆的详细图像描述生成

ReflectCAP: Detailed Image Captioning with Reflective Memory

上下文与知识上下文工程记忆Agent记忆

摘要

详细图像描述同时要求事实准确性和细粒度覆盖,而现有方法难以兼顾两者。我们以反思笔记引导的描述生成(Reflective Note-Guided Captioning, ReflectCAP)化解这一矛盾:多智能体流水线分析目标大型视觉-语言模型(LVLM)持续产生哪些幻觉、又系统性地忽视哪些内容,并将这些模式提炼为可复用的指南,称为结构化反思笔记(Structured Reflection Notes)。在推理时,这些笔记沿两个轴引导描述模型——应避免什么与应关注什么——生成在事实性与覆盖度上同时改进的详细描述。将该方法应用于覆盖GPT-4.1系列、Qwen系列和InternVL变体的8个LVLM,ReflectCAP达到事实性与覆盖度权衡的帕累托前沿,并在CapArena-Auto上取得显著收益——在该基准中,生成的描述与强参考模型进行正面交锋评判。此外,相比模型扩容或现有多智能体流水线(后者带来21--36\%的额外开销),ReflectCAP在描述质量与计算成本之间提供了更有利的权衡。这使得高质量详细描述生成在真实世界的成本与延迟约束下成为可行。

ReflectCAP:利用反思记忆的详细图像描述生成:论文配图
图 1:ReflectCAP 概述。在离线阶段,多智能体反思学习管道将目标 LVLM 反复出现的字幕错误和遗漏提炼为结构化反思笔记。在在线阶段,这些注释指导新图像的字幕生成,生成更好地平衡事实和覆盖范围的字幕。