论文

VLM 集成室内移动机器人的语义自主框架:混合确定性推理和跨机器人自适应记忆

A Semantic Autonomy Framework for VLM-Integrated Indoor Mobile Robots: Hybrid Deterministic Reasoning and Cross-Robot Adaptive Memory

摘要

自主室内移动机器人可以使用 ROS 2 Navigation 2 等既定框架可靠地导航到公制坐标,但它们缺乏解释表达意图而不是位置的自然语言指令的能力。视觉语言模型提供了弥补这一差距所需的语义推理,但其推理延迟(在消费类硬件上每个决策 2-9 秒)和逐个会话的健忘症限制了实际部署。本文提出了语义自治堆栈,这是一个用于语义自治室内导航的六层参考框架,并在具有现成边缘硬件的物理机器人上验证了具有混合确定性 VLM 推理和跨机器人自适应内存的完整实例。七步参数解析器可在 0.1 毫秒内处理 88% 的指令,而无需调用语言模型、相机或 GPU;只有真正不明确的指令才会升级为 VLM 推理。具有明确范围分类(全局环境知识、每个操作员偏好、每个机器人功能)的五类语义记忆框架可实现跨会话学习和跨机器人知识转移:通过一个机器人上的 VLM 交互学习的偏好被提升为确定性分辨率,并通过共享编译摘要转移到第二个机器人,实现测量延迟减少 103,000 倍。对两个定制差动驱动机器人进行的 82 个场景级决策和三个会话的实验验证显示了 100% 语义传输准确性(33/33,95% CI [0.894, 1.000])、100% 语义解析准确性和并发多机器人操作可行性 - 所有这些都在没有板载 GPU 的 Raspberry Pi 5 平台上进行,需要零训练数据。