论文

全息场景描述:走向 3D 场景的文本等效项

Holo-Captioning: Toward the Text Equivalent of 3D Scenes

模型评测基准与评测资源

摘要

这项工作引入了全息场景描述,这是一项新颖的任务,致力于寻找 3D 场景的文本等效项。作为第一步,我们将全息场景描述制定为生成结构化文本描述,全面描述 3D 场景中的所有实体 - 包括它们的语义标签、空间位置、属性和实体间关系。为了解决这一具有挑战性的任务,我们首先开发一个有效的字幕引擎来生成各个实体实例和实例对的详细描述,并提供包含超过 15K 个场景的大规模基准用于训练和评估。在此基础上,我们提出了 HoloScribe,这是一种新颖的模型,具有用于生成结构化全息场景描述的实例感知解耦管道,并进一步结合了锚感知实例链接来识别关系实例对。此外,我们提出了名为 HoloScore 的综合评估指标,并提供人工策划的测试集以确保可靠的模型评估。实验结果表明,HoloScribe 的性能显着优于最先进的 3D 密集字幕器和 3D LLM 通才,强调了我们方法的有效性。项目页面:https://visual-ai.github.io/holocap/