论文

使用 LLM 通过迭代强化学习和人类反馈生成自然且富有表现力的机器人手势

Generating Natural and Expressive Robot Gestures through Iterative Reinforcement Learning with Human Feedback using LLMs

模型训练偏好优化

摘要

富有表现力的手势对于自然有效的沟通至关重要,当仅靠口头提示(例如指向)不足以补充言语时,表达性手势是必不可少的。对于人形 Pepper 等社交机器人来说,产生自然且富有表现力的动作对于改善人机交互 (HRI) 和长期接受度至关重要。然而,由于依赖专家创作的动画,生成手势仍然具有挑战性,导致僵化的行为对于动态和多样化的环境来说是不切实际的。另外,机器学习方法通​​常难以捕捉感知的自然性,随着自由度的增加,变得越来越具有挑战性。因此,产生富有表现力的机器人手势需要一个能够适应环境,同时遵守社会规范和物理限制的系统。 大语言模型 (LLM) 的最新进展支持动态代码生成,为自然语言的运行时手势合成提供了新的机会。在本文中,我们将 ChatGPT 集成到人形机器人 Pepper 中,以生成与对话输出对齐的协同语音手势。虽然该基线可以实现灵活的手势生成,但生成的动作通常会被认为是僵硬且不自然的。为了解决这一限制,我们引入了带有人类反馈的迭代强化学习 (RLHF) 系统,该系统根据用户评估微调手势生成,利用迭代用户研究来比较 Pepper 生成的手势。我们的结果表明,RLHF 提高了 LLM 的协同语音生成能力,产生更具表现力、相关性和流畅的动作。