论文

LEGO-Anything:3D 场景重建的编码Agent

LEGO-Anything: Coding Agents for 3D Scene Reconstruction

智能体系统Agent Harness

摘要

当从单个图像重建的 3D 场景不是表示为渲染或固定的 3D 输出,而是表示为显式场景程序(其执行产生可以检查、编辑和查询的场景)时,它是最有用的。我们提出了 LEGO-Anything,一种图像到代码框架,其中编码Agent迭代地编写和执行 Blender 代码、检查场景和渲染并修改程序。为了评估端到端场景恢复,我们引入了 LEGO-Bench,这是一个基于模拟器的基准测试,包含来自 104 个不同室内和室外场景的 208 张图像。 LEGO-Bench 分别对工件有效性、可见表面几何形状和渲染外观进行评分。其基于模拟器的设计可实现可扩展性和精确的自动评估。在评估的Agent中,GPT-6-astra 取得了最强的总体结果,室内得分为 53.4%,室外得分为 39.6%,但在提供有效的场景伪影和忠实恢复场景几何形状和外观之间仍然存在很大差距。对智能体构建轨迹的分析揭示了三个反复出现的问题:弱场景初始化、迭代过程中的回归编辑以及不可靠的自我评估。这些发现激发了 LEGO-Plugin 的发展,这是一种无需训练的Harness插件,可实现更受控的迭代场景构建,它改进了所有六个评估模型,总体得分相对提升高达 62.7%。最后,我们测试重建的场景是否可以代表自然图像并支持视觉任务。在 LEGO-World 中,我们导出对象检测、实例掩码和相对深度,作为对 GPT-6-astra 重建的场景的确定性查询。这些读数显示了所有三项任务的出色性能,但远远低于专门的视觉模型,这表明当前编码Agent程序构建的场景是一种有前途但尚未足够精确的自然图像表示。