论文
物理人工智能的几何引导自洽
Geometry Guided Self-Consistency for Physical AI
摘要
最先进的物理人工智能模型通过扩散或流匹配,每次推理生成大量动作,迭代地将初始噪声样本细化为动作轨迹。因为这个推理过程本质上是随机的,所以每轮都致力于单一轨迹是脆弱的,并且这种脆弱性在构成完整情节的许多连续轮中复合。我们引入了 KeyStone,一种用于基于扩散的动作生成的推理时间自洽方法,它从共享模型上下文中并行绘制 $K$ 候选动作块,将它们聚集在连续动作空间中,并返回最大集群的中心点 - 不需要额外的模型。有两个特性使这一点变得实用。首先,动作轨迹的紧凑性使得扩散推理内存带宽受到限制,从而留下备用计算能力来并行运行 $K$ 链,而不会产生额外的挂钟延迟。其次,与距离没有语义意义且选择需要经过学习的判断的标记或像素空间不同,动作块是几何结构的,使得欧几里得距离直接反映物理相似性,使得选择有原则且无需判断。在不同的视觉语言动作模型 (VLA) 和世界动作模型 (WAM) 中,KeyStone 比单轨迹采样提高了高达 \textbf{13.3\%} 的任务成功率,并且延迟开销可以忽略不计,同时具有与基于模型的选择器相当的准确性,且无需训练成本。我们在 https://github.com/dywsjtu/keystone 开源了 KeyStone。