论文
连接语义学和运动学:零射击机器人操作的模块化框架
Bridging Semantics and Kinematics: A Modular Framework for Zero-Shot Robotic Manipulation
摘要
本文提出了一种模块化 无需训练 框架,用于在半结构化环境中进行零样本、语言引导的机器人操作。该架构通过将视觉-动作管道分解为三个阶段来弥合高级推理和底层运动学之间的差距:视觉感知、语义解释和任务执行。为了克服标准视觉语言模型 (VLM) 固有的空间模糊性和语义幻觉,感知模块采用 FastSAM 和标记集 (SoM) 提示动态生成有视觉依据的字母数字锚点。然后,相同的基础模型纯粹作为 大语言模型 (LLM) 运行,充当语义路由器,将不受约束的人类指令转换为可验证、可重新配置的配置。最后,这些配置由任务编排器动态解析为 MoveIt 任务构造器 (MTC),以生成无碰撞轨迹。该框架通过两个零样本实验设置进行评估:无约束的开放世界顺序操作和密集关系空间推理,在两种场景中实现了 62% 的端到端任务成功率,证明了其无需特定领域训练或手动坐标编程即可可靠执行复杂物理动作的能力。