论文

SceneParser:用于视觉语义理解的分层场景解析

SceneParser: Hierarchical Scene Parsing for Visual Semantics Understanding

应用与实践视觉感知与空间理解

摘要

一般场景感知已经从对象识别发展到开放词汇基础、部分定位和可供性预测。然而,这些功能通常被实现为孤立的预测,定位对象、部件或交互点,而不捕获面向交互的场景理解所需的结构化依赖关系。为了解决这一差距,我们引入了分层场景解析,这是一种面向交互的解析任务,它将物理场景表示为具有跨级绑定的显式场景 -> 对象 -> 部件 -> 可供性层次结构。我们使用 SceneParser 实例化此任务,这是一个基于 VLM 的解析器,经过训练可使用结构完成伪标签和课程学习进行统一分层生成。为了支持训练和评估,我们构建了 SceneParser-Bench,这是一个使用可扩展的分层数据引擎构建的大规模基准测试,包含 110K 训练图像、5K 验证分割、777K 对象、114M 零件、174M 可供性注释和 174M 有效对象-零件-可供性链实例。我们进一步引入 Level-1 到 Level-3 条件指标和 ParseRate 来评估本地化、跨级绑定和层次完整性。实验表明,现有的 MLLM 和感知缝合管道在我们的 SceneParser-Bench 上难以进行分层解析,而 SceneParser 实现了更强的结构感知性能。此外,对 COCO 和 AGD20K 的消融、评估以及下游规划探测表明我们的 SceneParser 与传统任务兼容,并为视觉理解提供了可操作的表示。