论文
空间策略,而不是行动:矢量量化测地线作为 LLM 驱动Agent的工具
Spatial Strategies, Not Actions: Vector-Quantized Geodesics as Tools for LLM-Driven Agents
摘要
基于大语言模型(LLM)的Agent经常因缺乏空间理解和主要利用统计文本模式而受到批评。我们通过将几何工具与大语言模型相结合的架构来研究他们的空间理解力,作为网格世界环境中的高级协调器。Agent首先收集测地线轨迹,然后对其进行矢量量化以提取代表性子集。离线时,大语言模型将潜在行为模式的自然语言描述与每个选定的轨迹相关联,使其成为一种工具。在网上,大语言模型根据当前状态和目标选择适当的工具。低级控制由执行与工具关联的轨迹的原始动作来处理。从 Agentic AI 的角度来看,这种方法将学习分为两个层次:工具发现是通过无监督的轨迹量化来处理的,而推理和决策则由大语言模型处理。我们使用开放视觉语言模型 (Qwen3.6-35B-A3B) 在部分可观察的动态 2D 网格环境中测试该方法。将几何衍生工具库与以Agent为中心的缩放工具和碰撞检测工具配对,可以让快速、非推理的配置与成本更高的思维链版本的目标达到率相匹配,同时将决策成本从几分钟缩短到几秒钟。