论文
SceneGraphVLM:使用视觉语言模型从视频生成动态场景图
SceneGraphVLM: Dynamic Scene Graph Generation from Video with Vision-Language Models
摘要
场景图生成为视觉感知提供了紧凑的结构化表示,但从图像和视频进行准确、快速的图预测仍然具有挑战性。最近基于 VLM 的方法可以将场景图端到端生成为结构化文本,但通常会产生具有不相关对象和关系的长输出。我们提出了 SceneGraphVLM,这是一种使用小型视觉语言模型生成图像和视频场景图的紧凑方法。 SceneGraphVLM 以词元高效的 TOON 格式序列化图形,并分两个阶段训练模型:监督 微调,然后是具有幻觉感知奖励的强化学习,平衡关系覆盖范围和精度,同时惩罚不支持的对象和关系。对于视频,模型可以选择调节先前生成的图表上的每个帧,从而提供轻量级短期上下文,而无需跟踪或后处理。我们在 PSG、PVSG 和 Action Genome 上评估 SceneGraphVLM。借助紧凑的 VLM 和 vLLM 加速解码,SceneGraphVLM 实现了强大的质量与速度权衡,改进了面向精度的 SGG 指标,同时保留了合理的召回率,并以大约一秒的延迟生成完整的场景图。代码和实现详细信息位于:https://github.com/markus0440/SceneGraphVLM.git。