从 LLM 生成的规范到学习的四足动物运动
From LLM-Generated Specifications to Learned Quadruped Locomotion
摘要
四足机器人的运动策略通常使用强化学习进行训练,而强化学习又严重依赖于手工设计的奖励函数。设计奖励函数需要大量的手动工程,并且通常不清楚哪些局部奖励会引发所需的全局行为。使用 Signal Temporal Logic (STL) 等语言的正式规范形成的奖励可以使奖励更具可解释性,但编写 STL 规范本身仍然需要领域专业知识。我们研究 大语言模型 (LLM) 是否可以通过生成随后用于策略学习的参数信号时间逻辑 (PSTL) 规范来填补这一空白。给定自然语言运动目标和约束规范语法,GPT-5.5 和 Qwen 3.6 独立提出用于命令跟踪、安全和步态结构的 STL 模板。我们使用专家轨迹实例化生成的 PSTL 模板的参数,并仅保留与演示的专家行为一致的规范。然后将所得规范转换为平滑的有限历史奖励函数,并用于在 MuJoCo XLA (MJX) 中通过近端策略优化 (PPO) 训练四足动物运动策略。我们评估 \emph{gait-aware} 和 \emph{gait-agnostic} 设置。前者指定步行小跑、小跑和束缚模式,而后者允许从任务目标中出现接触模式。我们与手工设计的奖励、Text2Reward 风格的 LLM 生成的奖励代码以及专家切换预言机进行比较。步态感知 Qwen 3.6 规范在所有测试速度 (0.3--2.1 m/s) 下实现了 100\% 的生存和命令成功,并在高速下匹配目标步态,而 Text2Reward 在 $\geq 1.9$ m/s 下的两个指标均达到 0\%。视频:https://stl-locomotion.github.io/