论文

大语言模型 中可扩展的对象关系编码可实现更好的 3D 空间推理

Scalable Object Relation Encoding for Better 3D Spatial Reasoning in Large Language Models

模型架构Transformer

摘要

空间推理侧重于根据 3D 场景中的空间关系来定位目标对象,这在开发智能体中发挥着至关重要的作用。由于3D场景-语言配对数据的可用性有限,从头开始训练具有强推理能力的模型具有挑战性。先前的方法尝试将 3D 场景表示注入到 大语言模型 (LLM) 的输入空间中,并利用预训练的理解和推理能力进行空间推理。然而,编码绝对位置的模型很难从过早融合的特征中提取空间关系,而作为输入标记显式编码所有空间关系(对象数量的二次方)的方法则面临着较差的可扩展性。为了解决这些限制,我们提出了 QuatRoPE,一种新颖的位置嵌入方法,其输入长度与对象数量成线性,并通过注意力层中的点积显式计算成对空间关系。 QuatRoPE 的 3D 坐标整体矢量编码可保证高度的空间一致性,保持场景几何完整性的保真度。此外,我们引入了隔离门控RoPE扩展(IGRE),它有效地限制了QuatRoPE对对象相关词元的影响,从而最大限度地减少对LLM现有位置嵌入的干扰并保持LLM的原始功能。大量的实验证明了我们方法的有效性。代码和数据可在 https://github.com/oceanflowlab/QuatRoPE 获取。