论文

内心言语作为行为指南:面向人机协作的多样行为可控模仿

Inner Speech as Behavior Guides: Steerable Imitation of Diverse Behaviors for Human-AI coordination

模型训练合成数据

摘要

有效的人机协作要求人工智能体能够展现并回应类人行为,同时适应不断变化的情境。模仿学习已成为构建此类智能体的主要方法之一,即训练智能体模仿人类演示的行为。然而,现有方法难以捕捉人类行为固有的多样性与非马尔可夫性,且缺乏在推理时控制行为的能力。受人类认知过程理论启发——内心言语在执行前引导动作选择——我们提出 MIMIC(Modeling Inner Motivations for Imitation and Control),一个以语言作为行为意图内部表示的框架。MIMIC 新颖地使用视觉语言模型作为语言支架,训练一个能从观察生成内心言语的条件变分自编码器;随后由基于扩散的行为克隆策略在当前观察与所生成内心言语的条件下选择动作。MIMIC 通过以行为特定的言语为条件,实现推理时对行为的细粒度控制。在机器人操作任务与人机协作游戏上的实验表明,MIMIC 显著提升行为多样性和对人类演示的保真度,同时无需在额外演示上训练即可实现细腻的行为控制。我们在 https://mimic-research.github.io 开源代码并提供预训练 MIMIC 智能体与定性演示。

内心言语作为行为指南:面向人机协作的多样行为可控模仿
图2:MIMIC 概览:智能体的内心言语(inner speech)通过使用预训练 VLM 区分人类演示中的不同行为而得到支撑。接下来,我们训练一个以该内心言语为条件的 DDPM-T(采用 transformer 架构的扩散策略)行为克隆器,以及一个以状态历史为条件的基于 VAE 的内心言语生成器。在仿真过程中,内心言语会被周期性地生成,基于其过去生成的动作来影响行为克隆器。