论文

EvoNav:使用 大语言模型 进行机器人导航的进化奖励函数设计

EvoNav: Evolutionary Reward Function Design for Robot Navigation with Large Language Models

模型训练奖励建模与过程监督

摘要

机器人导航是动态人类环境中社交机器人应用的一项关键任务。虽然强化学习(RL)在解决这个问题方面表现出了巨大的希望,但策略质量对奖励函数的规范高度敏感。手工设计的奖励需要大量的领域专业知识,并且嵌入难以审核或适应的归纳偏差,限制了其有效性并导致绩效不佳。在本文中,我们提出了 EvoNav,这是一种进化框架,可通过 大语言模型 (LLM) 自动设计机器人导航奖励功能。为了克服成本高昂的政策训练,EvoNav 通过渐进的三阶段预热提升程序来评估 LLM 中的每个候选提案。 EvoNav 从具有低成本替代物(例如小型数据集和分析规则)的分析代理,发展到轻量级部署,最后发展到全面的策略训练,从而在有效反馈下实现计算高效的探索。实验结果表明,EvoNav 比手动设计的 RL 奖励和最先进的奖励设计方法产生更有效的导航策略。