论文
从符号到几何:在 大语言模型 中启用空间推理
From Symbolic to Geometric: Enabling Spatial Reasoning in Large Language Models
摘要
最近的大语言模型(LLM)经常表现出空间推理能力;然而,这种能力很大程度上是\emph{符号},源于空间语言上的模式匹配,而不是真正的\emph{几何}空间推理。由于 LLM 对离散标记进行操作,因此它们缺乏对连续空间表示、显式几何计算和结构化空间运算符的本机支持。为了解决这个限制,我们引入了 \emph{空间语言模型 (SLM)},这是第一个多模态 LLM,它将位置信息视为一流模态,并在模型的推理过程中实现几何空间推理。 SLM 直接对学习的空间表示进行操作,而不是对空间关系的文本描述进行操作。为了支持有效的训练,我们构建了一个 \emph{空间指令数据集} 来对齐空间表示、原子几何运算和自然语言指令。我们进一步提出了一个名为 \emph{SpatialEval} 的新基准,旨在评估跨属性、距离、拓扑和相对位置任务的空间推理。大量实验表明,SLM 显着优于现有的基于 LLM 的方法,这些方法依赖于通过即时工程或文本抽象进行符号推理,证明了集成几何空间表示以实现稳健的空间推理的好处。我们的指令数据集、评估基准、模型训练 代码和模型检查点可以在以下位置找到:\hyperlink{https://github.com/chuchen2017/SLM}{https://github.com/chuchen2017/SLM}。