论文
具有即时条件场景奖励的可控图像字幕
Controllable Image Captioning with Prompt-Conditioned Scene Rewards
摘要
大型视觉语言模型可生成流畅的图像描述,但提供有限的语义控制:用户无法可靠地指定说明文字是否应强调属性、关系或特定图像区域。我们提出了使用场景奖励的细粒度字幕控制(FoCUS),这是一种可控的图像字幕方法,可让用户通过自然语言控制提示将字幕引导至特定的语义重点。核心思想是基于场景图对齐组件分数的提示条件控制目标。生成的标题被解析并与场景图组件(例如对象、属性和关系)对齐。根据所要求的重点,这些组成部分具有不同的权重,包括负权重。我们使用 GRPO 优化该目标,并通过更严格的对象有效性阈值和基于推理的属性和关系评分验证进一步提高其可靠性。为了评估可控性,我们引入了语义控制和精度评估 (SCoPE),这是一个具有对比包含/避免约束的基准,用于测量目标内容覆盖范围和范围外抑制。在两个 VLM 主干上进行的实验表明,FoCUS 持续提高了可控性和细粒度字幕质量,而不会降低总体字幕性能。