论文

2.5维分解:基于LLM的空间构建

2.5-D Decomposition for LLM-Based Spatial Construction

模型推理智能体系统推理策略与问题分解Agent Harness

摘要

根据自然语言指令构建结构的自治系统需要可靠的空间推理,但大语言模型 (LLM) 在生成三维块布局时会产生系统坐标错误。我们提出了一个基于 \emph{2.5-D 分解} 的神经符号管道:LLM 在二维水平面上进行规划,而确定性执行器根据列占用情况计算所有垂直位置,从而消除了一整类错误。在“Build What I Mean”基准测试(160 轮)上,采用该流程的 GPT-4o-mini 在 12 次独立运行中实现了 94.6% 的平均结构精度,与架构师代理错误所造成的 97.6% 上限相差 3.0 个百分点,而构建者方面的改进无法解决这一问题。这优于 GPT-4o(90.3%)和最佳竞争系统(76.3%)。受控消融证实 2.5 维分解是主要贡献者,占准确度的 50.7 个百分点。管道直接传输到边缘硬件:在 NVIDIA Jetson Thor AGX 上本地运行的 Nemotron-3 120B 与云结果的匹配率为 94.5%,无需立即修改。基本原则是从大语言模型的输出空间中消除确定性维度,适用于重力或其他物理约束固定一个或多个自由度的任何自主构造或装配任务。对 500 个 IGLU 协作构建任务进行的迁移实验证实,该效果普遍超出了主要基准。