论文

DexSIM:具有统一因果视频扩散的实时灵巧模拟

DexSIM: Real-time Dexterous Simulation with Unified Causal Video Diffusion

模型推理KV Cache

摘要

视频扩散模型的最新进展使得对物理世界的广泛模拟成为可能。而手部物体交互的模拟却较少被探索。我们提出了 DexSIM,一种用于实时模拟灵巧操作的灵巧模拟框架。虽然之前利用视频扩散和 3D 重建的工作主要集中在导航上,但灵巧的操作受到限制,而它在创建与模拟世界的交互体验以及为机器人生成合成数据方面有着广泛的应用。现有方法缺乏实时交互性和长期空间一致性和记忆性。我们提出了 DexSIM 的两阶段训练框架。首先,我们通过将手部动作轨迹和视频联合嵌入到统一的特征空间中来训练双向视频扩散模型。我们利用高斯热图手部编码来实现更准确的手部表示。然后,我们使用更新的空间缓存作为空间记忆的注意力池进行基于推出的自回归训练,这提高了长期一致性和 3D 感知灵巧操作模拟。 DexSIM 在像素和语义相似性、运动保真度和手部投影准确性方面优于基线。它还允许新的应用程序,例如手部动作传输,并以 15.24 FPS 的实时交互速度运行。