论文

使用对象和照明进行引擎原生可编辑 3D 世界重建

Engine-Native Editable 3D World Reconstruction with Objects and Lighting

应用与实践视觉感知与空间理解

摘要

可编辑的 3D 场景创建需要可以检查、移动和导入到标准引擎中的对象实例和灯光,但现有的单图像方法很大程度上停留在房间规模的几何体、烘焙/全局照明或文本驱动的生成上。我们介绍 Lumera(光感知统一引擎原生重建和组装),这是一个基准和参考管道,用于从单个图像解析引擎原生、光感知 3D 场景。 Lumera-2K 由 2,513 个 UE5 项目构建而成,提供 373 万个组件、6300 万个对象实例、102.6K 引擎原生参数化灯光和 95.1K 摄像机视图。在此数据上,Lumera-Box 和 Lumera-Light 采用 VLM 来解析对象框和参数化光元组 (x,y,z,r,g,b,I),这些元组通过每个对象的网格重建、HDR 环境估计和有界代理细化循环进行组装。在针对 DetAny3D、SpatialLM、N3D-VLM 和 WildDet3D 的净化框基准测试中,Lumera-Box 获得了最强的整体检测、几何、语义和布局分数(合并 mAP 0.1141、IoU-B 0.2472、F 分数 0.2762),而 WildDet3D 在锚点召回方面仍然更强。对于灯光,Lumera-Light 可以恢复几乎所有非空场景(召回率 0.998),但在单个灯光定位方面仍然受到限制(0.5 m 处的 F1 0.209);匹配灯的中位位置误差为 0.261 m,中位 ΔE2000 为 4.59,强度 Pearson r=0.628。这些结果将参数化灯光建立为可测量的可编辑场景目标,并暴露了关系结构、灯光回忆/强度和跨引擎泛化方面的剩余瓶颈。