论文

剑、盾和致命弱点:表征 大语言模型 在导航规划中的空间推理的语言归纳偏差

The Sword, Shield, and Achilles' Heel: Characterizing the Linguistic Inductive Bias of Large Language Models for Spatial Reasoning in Navigation Planning

模型评测模型行为与机制分析

摘要

基于 大语言模型 (LLM) 的导航系统通常构建显式空间表示(例如拓扑图、语义栅格图)并将其转换为文本描述作为 LLM 的输入。然而,这种基于文本的空间表示的语言结构以及它们所包含的上下文特征(例如拓扑、几何)的选择通常被视为中立的工程决策,而不是塑造 LLM 行为的关键因素。为了填补这一空白,我们提出了一个双重干预框架,将语言结构与不同的上下文线索分开,以评估 LLM 用于导航规划的语言归纳偏差。在该框架中,表征干预改变了语言格式和语言压缩程度,澄清了语言表征何时支持或抑制导航规划。语境干预结合语境特征组合和冲突探测,明确阐明了 LLM 在处理不同语境线索时的偏好和弱点。跨不同空间推理任务和多个模型尺度的实验揭示了一致的模式:拓扑信息是坚固的盾牌和稳健规划的支柱;语言格式是一把双刃剑,其效果取决于模型大小、任务需求和压缩级别;语义信息是致命的致命弱点——不正确的语义线索会系统性地破坏规划过程。总的来说,我们的研究表明,基于 LLM 的导航中有效的基于文本的空间表示应该保持拓扑完整性,校准表示压缩以模型容量,并确保语义正确性,而不是简单地采用单一表示。我们的代码可在 https://github.com/jonesdong150/LLM-Navigation-Inducing-Bias 上公开获取。