论文
迈向连续运动语言代理:用于增量运动理解和生成的 LoRA 变体
Towards Continual Motion-Language Agents: LoRA Variants for Incremental Motion Understanding and Generation
摘要
运动语言智能体必须具备双向能力,既能理解人类运动(运动到文本,M2T),又能从自然语言生成运动(文本到运动,T2M)。虽然基础模型在静态环境中取得了强大的性能,但在动态环境中运行的自主代理必须不断融入新的运动概念——例如新颖的运动风格或专门的手势——而不会灾难性地忘记以前获得的技能。我们研究了顺序任务暴露下双向运动语言学习的稳定性与可塑性权衡。在冻结的 大语言模型 主干基础上,我们引入了低秩适应 (LoRA) 变体,旨在减轻任务间干扰。我们特别提出了混合专家架构,该架构利用基于自动编码器的路由器在推理时选择特定于任务的专家,因此不需要任务标签。为了评估这些方法,我们通过运动描述的语义聚类建立了从 HumanML3D 派生的可重复的五任务基准。我们的实验结果表明,M2T 和 T2M 方向的遗忘几乎为零,同时保持高生成和字幕质量。此外,我们表明,在质量指标方面,通过路由进行的硬专家选择明显优于软专家混合,这表明保持专家隔离对于维持持续学习环境中的性能至关重要。最后,我们观察到 词元级 准确性和下游生成质量之间可能会出现分歧,这凸显了在未来的终身运动语言代理研究中需要更全面的评估协议。