论文

M$^3$P-R1:通过 MIP 代码生成强化学习大型语言模型引导的多模态运动规划

M$^3$P-R1: Reinforcement Learning for Large Language Model Guided Multi-Modal Motion Planning via MIP Code Generation

模型训练强化学习

摘要

多模态运动规划(M$^3$P)需要对连续运动和离散模式转换进行联合推理,因此很难有效求解。例如,双足机器人可以走到目标位置,然后用手臂抓住物体。该场景捕获了模式转换和连续动态,产生了纯离散规划器和连续规划器都无法处理的可行路径。虽然混合整数规划 (MIP) 提供了一个原则框架,但为非凸问题构建易于处理的公式通常是手动且针对特定领域的,特别是在非凸机器人任务所需的基于离散化的近似 MIP 机制中。我们提出了 M$^3$P-R1,这是一种强化学习方法,可微调大型语言模型 (LLM),将 M$^3$P 任务分解为 MIP 变量、约束和目标。该模型不是直接输出通常容易产生幻觉的答案,而是使用 MIP 优化库和约束接口生成可执行的 Python 代码。这使得求解器支持的执行能够实现稳健且可验证的解决方案。通过针对求解器的结果驱动奖励进行训练,M$^3$P-R1 学习构建模态级离散化原语并综合跨模态耦合约束,为复杂的 M$^3$P 任务生成可执行的 MIP 程序。