论文
通过受约束的 LLM 连接语义和物理,实现安全可靠的机器人操作
Bridging Semantics and Physics with Constrained LLMs for Safe and Trustworthy Robotic Manipulation
摘要
在真实厨房中操作的语言引导机器人必须做的不仅仅是制定看起来正确的计划。它还必须在杂乱的环境中、在不完美的感知下安全地执行该计划。 大语言模型 (LLM) 可以将指令分解为动作序列,但语言与动作之间的差距仍然存在:计划可能在语言上看似有效,但在运动学和碰撞约束下在物理上不可行。我们通过将推理执行边界形式化为类型化契约来弥补这一差距。根据 RGB-D 观察,系统将感知对象置于明确的碰撞感知场景模型中,并通过模型上下文协议 (MCP) 定义的模式验证工具调用来约束语言级决策,在格式错误的命令到达机器人之前拒绝它们。每个经过验证的调用都确定性地基于 MoveIt 任务构造器管道,其中在“验证然后行动”步骤中根据重建的规划场景评估候选运动。只有通过运动学和碰撞检查的轨迹才会发送给机器人。在物理 UFactory 850 上,该方法在涉及液体、颗粒介质和离散固体的浇注任务中,在每个任务的 10 次试验中取得了高达 80% 的成功。使用相同的规划、协议和验证堆栈,它在抓取和放置任务中取得了 90% 的成功。尽管脚本化策略在最简单的任务上稍微优于我们的方法,但在最困难的任务上它的成功率下降到 10%,而我们的方法的成功率是 60%。