论文
LiMA:通过异步扩散将长期想象力与实时灵巧操纵联系起来
LiMA: Bridging Long-term Imagination to Real-time Dexterous Manipulation via Asynchronous Diffusion
摘要
灵巧的操控需要长期的预见性和快速的反应控制。视觉-语言-动作(VLA)模型虽然精通高级推理,但通常缺乏对物理动力学和空间感知的细粒度理解。相反,世界动作模型 (WAM) 通常会因迭代生成而遭受高推理延迟的影响。这些缺陷导致严重的时间错位,模型的意图无法适应快速的物理接触变化。为了克服这一根本瓶颈,我们提出了 LiMA,这是一种异步双系统生成框架,可以系统地将意图规划与反应执行分离。 LiMA 将计算组织为多尺度层次结构:慢速系统处理稀疏的长视野时空意图生成,而快速系统则专注于密集的高频运动细化。为了使稀疏意图预测与密集动作轨迹保持一致,我们引入了潜在薛定谔桥耦合机制,将细化公式化为熵正则化概率传输过程。与 Cosmos-Policy 相比,LiMA 通过异步解耦将推理延迟降低了 45.8%。在跨越多个视野的六项双手灵巧操作任务的评估中,LiMA 的总体成功率为 70.8%,平均子任务成功率为 78.9%,同时在未见过的场景中保持了性能。该项目网站可通过此 https URL 访问