论文

部分可观测下基于文本的LLM探索与导航

LLMs for Text-Based Exploration and Navigation Under Partial Observability

智能体系统Agent任务评测

摘要

在未知布局中的探索与目标导向导航是巡检、物流与搜救任务的核心。我们探究大语言模型(LLM)能否在部分可观测条件下充当纯文本(text-only)控制器——不借助代码执行、工具或程序合成。我们在固定ASCII网格世界中引入一个带预言机定位的可复现基准:每一步只向模型暴露智能体周围的局部5×5窗口,模型必须从UP/RIGHT/DOWN/LEFT中选择其一。九个当代LLM——涵盖开源/闭源、稠密/混合专家(Mixture of Experts)、指令微调与推理微调——在难度递增的三种布局上的两项任务中接受评估:探索(Exploration,最大化已揭示格子数)与导航(Navigation,沿最短路径抵达目标)。实验结果以定量指标评估,包括成功率、归一化覆盖率与相对预言机的路径长度等效率指标,并辅以定性分析。推理微调模型能在所有布局上可靠完成导航,但效率仍不及预言机路径。提示中的少样本示例主要通过减少无效动作和缩短路径来帮助这些推理微调模型,而经典的稠密指令模型表现仍不稳定。我们观察到特征性的动作先验(UP/RIGHT),其在部分可观测下可能诱发循环。总体而言,训练方案与测试时的深思比原始参数量更能预测控制能力。这些发现表明,与经典在线规划器做轻量混合是通往可部署部分建图系统的一条务实路线。