论文
OmniDex:扩展到多样杂乱场景的灵巧手抓取
OmniDex: Scaling Dexterous Hand Grasping to Diverse Cluttered Scenes
摘要
灵巧抓取是具身AI的基础动作,需要大量数据来训练稳健模型。真实数据采集昂贵,因此仿真成为主流。然而,杂乱场景最贴近真实应用,学习其中的抓取却受到大规模数据匮乏的限制。我们整理高质量三维物体及支撑底座,提出可扩展的种子生成与筛选策略,绕过缓慢的场景级优化。由此构建包含超过260万场景和4亿条场景专属抓取真值的基准,提供多样真实布局及丰富语义、几何观测。我们进一步提出OmniDex模型,解决现有生成模型的抓取多模态性与最后毫米的精度问题。在训练中结合Soft Winner-Takes-All学习与受人类启发的物理约束,并采用物理驱动的排序,无需耗时的后优化即可实现稳健灵巧抓取。实验表明,OmniDex在多样场景、视角和未见物体上取得先进表现及较强泛化能力。