论文

连接思想和行动:使用 MetaTool 增强的 ROS 框架克服开源 LLM 代理中的长期不稳定性

Bridging Thought and Action: Taming Long-Horizon Instability in Open-Source LLM Agents with a MetaTool-Enhanced ROS Framework

智能体系统Agent 规划

摘要

大型语言模型 (LLM) 实现了更自然的人机交互,但开源模型在部署在代理机器人框架中时通常表现出不稳定的长期推理和低效的动作执行。本文提出了一种基于增强型 ROS-Agent 的架构,该架构使用开源 LLM 提高了代理机器人系统的任务可靠性和执行效率。所提出的系统引入了一种新颖的中间机制,称为 MetaTool,它在行动执行之前强制执行结构化规划。给定自然语言命令,MetaTool 会引导 LLM 生成预期工具调用的伪代码计划,该计划存储在 ROS-Agent 的暂存器中并在整个执行过程中持续存在。通过明确地将计划与执行分开,所提出的方法减少了执行循环并改进了确定性行为。该架构在具有多模式感知和运动控制功能的定制移动机器人平台上进行了验证。现实世界交互式任务的实验结果表明,任务完成度和上下文一致性得到了改善,与基线框架相比,复杂任务的增益高达约 24%。