论文
SalsaAgent:用于交互式舞蹈生成的多模态体现语言模型
SalsaAgent: A multimodal embodied language model for interactive dance generation
摘要
与人形机器人的具体交互依赖于双向非语言反应、协调和同步来传达线索并与伙伴一起移动。对于社交互动的实体主体,反应性运动的生成需要富有表现力的全身运动,该运动在保持空间和时间同步的同时保持上下文适当。我们提出了 SalsaAgent,这是一种语言模型,可以根据人类领导者和音乐生成富有表现力的全身萨尔萨跟随者动作。我们将合作伙伴交互制定为非语言词元传递,扩展 大语言模型 (LLM) 的词汇表以处理离散运动词元、成对关系词元和音频词元。我们的方法引入了全身和成对关系标记器,将语言和运动标记与自动导出的骨架动力学文本描述对齐,并应用了两阶段标记到扩散管道。主观和客观评估显示,相对于之前的基线,运动质量、两人空间协调性以及音乐和伙伴协调性得到了改善。