论文

用于视觉-语言-动作操作的 Real2Sim2Real:基于 AMD ROCm 的管道

Real2Sim2Real for Vision-Language-Action Manipulation: An AMD ROCm-Based Pipeline

AI 基础设施模型部署

摘要

物理人工智能——大型视觉-语言-动作(VLA)模型与在现实世界中行动的实体代理的集成——已成为人工智能的下一个主要前沿领域,黄仁勋(“下一个大事件是物理人工智能,有身体的人工智能”,GTC Paris,2025 年 6 月)和 Lisa Su 博士(“我们正在进入物理人工智能的世界……这就是人工智能进入现实世界的地方,”CES 2026)等行业领袖对此表示赞同。本文提出了一种用于具体操作的端到端、完全 AMD 加速的技术堆栈,涵盖数据中心训练芯片、Radeon PRO 模拟/渲染 GPU 和 Ryzen AI 边缘计算,并由开放 ROCm 软件堆栈统一。我们证明,训练和部署基于 VLA 的操纵策略不需要 CUDA 锁定的生态系统。提出了四个渐进式演示:(1)用 SmolVLA 训练并部署在实体 Franka 手臂上的 Sim-to-Real 操纵管道; (2) 语义的、基于语言的对象选择任务(“三选​​一”); (3) Real2Sim 合成数据生成管道,将真实场景的 3D 高斯泼溅 (3DGS) 重建与 Genesis 物理引擎相融合; (4) 针对四足动物和人形运动的大规模强化学习,在多个硬件平台上进行基准测试。所有管道均在 RDNA4 (Radeon AI PRO R9700) 和 RDNA3.5 (Radeon PRO W7900) 硬件上的 ROCm + PyTorch 上本机运行,并且可在免费的 Radeon 云平台上重现。