论文

SceneCritic:3D 室内场景合成的符号评估器

SceneCritic: A Symbolic Evaluator for 3D Indoor Scene Synthesis

模型评测评测方法与指标

摘要

大语言模型 (LLM) 和视觉语言模型 (VLM) 越来越多地通过布局和场景图等中间结构生成室内场景,但评估仍然依赖于对渲染视图进行评分的 LLM 或 VLM 判断,使判断对视点、提示措辞和幻觉敏感。当评估器不稳定时,就很难确定模型是否生成了空间上合理的场景,或者输出分数是否反映了视点、渲染或提示的选择。我们引入了 SceneCritic,一个用于平面图级别布局的符号评估器。 SceneCritic 的约束基于 SceneOnto,这是我们通过聚合来自 3D-FRONT、ScanNet 和 Visual Genome 的室内场景先验构建的结构化空间本体。 SceneOnto 遍历此本体,共同验证对象关系之间的语义、方向和几何一致性,提供对象级和关系级评估,以识别特定违规和成功放置。此外,我们将 SceneCritic 与迭代细化测试床配对,探索模型如何在不同批评模式下构建和修改空间结构:使用碰撞约束作为反馈的基于规则的批评家、对布局作为文本进行操作的 LLM 批评家以及对渲染观察结果进行操作的 VLM 批评家。通过大量实验,我们表明(a)SceneCritic 比基于 VLM 的评估器更符合人类判断,(b)纯文本 LLM 可以在语义布局质量上优于 VLM,以及(c)基于图像的 VLM 细化是语义和方向校正的最有效的批评模式。