论文

用于在不破坏本地学习稳定性的情况下细化机器人策略的模式限制语言模型

A Schema Bounded Language Model for Refining Robot Policies Without Destabilizing Local Learning

智能体系统Agent 架构与控制循环

摘要

本文解决了当策略推理和本地控制在不同更新级别运行时,在分散系统中复合异构机器人的导航问题。在 NetLogo-Python 实现中,三个机器人共享运动动力学,但使用不同的 LLM 后端。每个机器人独立地组合了一个大语言模型(LLM)策略代理、一个上置信边界(UCB)老虎机和一个双深度Q网络(Double DQN)控制器;没有中央 LLM 生成团队操作。 LLM 推理仅限于回合级策略生成和细化,而不是刻度级动作选择。机器人通过包含策略、结果和学习反馈的共享回合摘要执行跨 LLM 通信。 UCB 执行细化模式选择,策略条件的 Double DQN 根据导航变量、活动策略参数和 LLM 操作先验执行刻度级操作选择。四种配置中的每一种都经过了 30 轮的评估。在固定模拟中,完整配置达到了所有90个相关机器人回合记录中的目标,并取得了最低的中位完成时间(42个ticks)和P90(73.2个ticks);其中位数比其他配置低 25.0--39.1%。这些观察结果提供了来自评估配置的描述性配置级证据。