论文
以人物自身坐标系理解空间关系的图像描述
Human-Centric Image Captioning with Subject-Centered Spatial Understanding
摘要
虽然多模态 大语言模型 (MLLM) 在通用图像字幕方面取得了显着的性能,但它们在以人为中心的场景中经常遭受结构幻觉的困扰。准确地建模人体对象是关键下游应用的基础,例如准确的头像/视频/图像生成和细粒度的人类动作理解。然而,这些任务需要高度精确的以主体为中心的空间基础,例如区分自我中心的左/右偏性和保持正确的解剖-物体绑定。尽管对结构完整性来说是灾难性的,但这些局部空间倒转常常被现有基准中的整体描述性指标所掩盖。为了系统地揭示和量化这一瓶颈,我们引入了 SPACE(以主体为中心的姿势、外观和特征评估),这是一个旨在评估以主体为中心的空间理解的基准。在 SPACE 上,我们发现,尽管有很强的通用感知,但当前的 MLLM 始终无法在人物的内在坐标系中进行描述。为了弥补这一差距,我们提出了专门的数据构建和对齐管道。我们首先从细粒度的身体部位定位中提取结构化的空间提示,以指导两阶段的字幕重写过程,从而产生高度空间忠实的训练数据。此外,我们为组相对策略优化(GRPO)设计了基于规则的奖励,明确惩罚对齐过程中结构性关键空间错误。 SPACE 上的大量实验表明,我们的框架显着提高了以人为中心的字幕质量,特别是在以人物为中心的空间推理方面,实现了与强大的闭源模型竞争的性能。我们的基准测试和代码可在 https://github.com/JHang2020/SPACE-Eval 获取。