论文
CoRAL:基于接触丰富的自适应 LLM 的机器人操作控制
CoRAL: Contact-Rich Adaptive LLM-based Control for Robotic Manipulation
摘要
虽然 大语言模型 (LLM) 和视觉语言模型 (VLM) 在高级推理和语义理解方面表现出卓越的能力,但由于缺乏明确的物理基础且无法执行自适应控制,将它们直接应用于接触丰富的操作仍然是一个挑战。为了弥补这一差距,我们提出了 CoRAL(基于接触丰富自适应 LLM 的控制),这是一种模块化框架,通过将高级推理与低级控制解耦来实现零样本规划。与黑盒策略不同,CoRAL 不使用 LLM 作为直接控制器,而是作为成本设计器,为基于采样的运动规划器 (MPPI) 合成上下文感知目标函数。为了解决视觉数据中物理参数的模糊性,我们引入了神经符号适应循环:VLM 为环境动力学提供语义先验,例如质量和摩擦估计,然后通过在线系统识别实时明确地细化,而 LLM 迭代地调节成本函数结构,以根据交互反馈纠正策略错误。此外,基于检索的内存单元允许系统在重复任务中重用成功的策略。这种分层架构通过将高级语义推理与反应式执行解耦来确保实时控制稳定性,有效弥合缓慢的 LLM 推理与动态联系需求之间的差距。我们在模拟和现实世界的硬件上验证 CoRAL 的挑战性和新颖性任务,例如利用外部接触将物体翻转到墙上。实验表明,CoRAL 的性能优于最先进的 VLA 和基于基础模型的规划器基线,在未见过的接触丰富的场景中将成功率平均提高了 50% 以上,并通过其自适应物理理解有效地处理了模拟与真实的差距。