论文

Pepper 机器人上低延迟、LLM 驱动的多模态交互框架

A Framework for Low-Latency, LLM-driven Multimodal Interaction on the Pepper Robot

摘要

尽管在大语言模型(LLM)与社交机器人结合方面已有近期进展,两个弱点依然存在。第一,Pepper 等平台上的现有实现通常依赖级联的语音转文本(STT)->LLM->文本转语音(TTS)管线,导致高延迟和副语言信息的丢失。第二,多数实现未能充分发挥 LLM 在多模态感知和 Agentic 控制方面的能力。我们提出一个面向 Pepper 机器人的开源 Android 框架,通过两项关键创新解决这些局限。第一,我们集成端到端的语音到语音(S2S)模型,实现低延迟交互,同时保留副语言线索并支持自适应语调。第二,我们实现了广泛的函数调用(Function Calling)能力,将 LLM 提升为 Agentic 规划器,编排机器人动作(导航、注视控制、平板交互)并整合多样的多模态反馈(视觉、触觉、系统状态)。该框架运行在机器人的平板上,也可以构建为在普通 Android 手机或平板上运行,使开发与机器人硬件解耦。这项工作为 HRI 社区提供了一个实用、可扩展的平台,用于探索先进的 LLM 驱动的具身交互。

Pepper 机器人上低延迟、LLM 驱动的多模态交互框架 配图
图 1:系统架构对比,展示传统级联流水线与所提出的低时延多模态框架。图中将传统 STT-LLM-TTS 流水线与使用端到端 S2S 模型的所提出框架进行对比。