论文
协同策略:响应式人机共同创造音乐表演
Co-policy: Responsive Human-Robot Co-Creation for Musical Performances
摘要
艺术长期以来一直是人类创造力的关键表达。具身人工智能为生成模型提供了一条通过身体动作而不是无形的数字内容参与创造力的途径。在机器人音乐共同创作中,将语义音乐理解与实时且物理可执行的表演联系起来具有挑战性。我们提出了 Co-policy,一个人机音乐共同创作的框架,它将语义意图定位、受限音乐变化和视觉运动执行分开。为了奠定音乐语义的基础,协同策略使用预推理语义锚和微调的 Qwen-vl 规划器 (F-Qwen) 将语音、现场音乐种子和视觉观察转化为结构化的共同创作计划。为了支持低延迟执行,协同策略引入了高斯混合视觉运动策略(GMP),作为条件混合密度策略实施,在单次前向传递中将目标注释和视觉上下文映射到多模态机器人动作。与仅再现用户指定音符的机器人播放系统不同,协同策略在音乐和物理约束下生成互补的音乐响应。真实的机器人铃声实验、消融和专家评估表明,与扩散策略和消融基线相比,意图一致性、执行准确性和响应频率得到了改善,支持物理基础的动作生成,作为具体人类与人工智能共同创造的关键要求。