论文

文本到 3D 策略:针对未见规范泛化的细粒度语言行为对齐

Text-to-3D Policy: Fine-Grained Language-Behavior Alignment for Unseen Specification Generalization

模型训练监督微调与指令调优

摘要

3D 视觉运动策略为空间精确操纵提供了坚实的基础,但当前的文本到 3D 策略很难遵循超出演示范围的看不见的细粒度行为规范。我们将这一挑战作为看不见的规范概括来研究,其中语言指定了行为上的显着变化,例如目标位置、位移或铰接状态,而这些变化是政策训练中所缺少的。我们发现预训练的语言表示和传统的全局行为语言对齐捕获了粗略的任务语义,但经常模糊需要不同行为的附近规范。我们引入了 T3DP,一种用于细粒度语言行为对齐的文本到 3D 策略框架。 T3DP 不是将每个指令和演示压缩为单个全局嵌入,而是保留其局部结构并在语言元素和行为片段之间建立双向标记级对应关系。这直接奠定了它们所影响的行为组件中微妙的语言变化,从而防止密切相关的规范在表示空间中崩溃。由此产生的规范敏感语言表示以基于点云的 3D 扩散策略为条件,从而能够更精确地控制看不见的行为规范,而无需修改底层策略架构。在 Meta-World、ManiSkill 和 RoboTwin 中,T3DP 将全球语言行为对齐的平均保留规范成功率提高了 +11.0-14.2 个百分点,在所有 15 个任务系列上都有所提高;在真实的机器人任务中,它进一步将平均成功率从 47.5% 提高到 65.0%(+17.5 分)。表示和动作探针分析表明,细粒度对齐更好地保留了规范几何形状和动作相关的变化,将局部行为基础与下游控制联系起来。