论文
SiMDex:挖掘类似的以自我为中心的视频以进行跨实体灵巧操作
SiMDex: Mining Similar Egocentric Videos for Cross-Embodiment Dexterous Manipulation
摘要
近年来,以自我为中心的人类视频扩展用于机器人操作的爆炸性趋势,但仍不清楚哪些数据真正有利于灵巧的操作。我们提出了 SiMDex,一个基于相似性的数据挖掘框架,它将灵巧操作中的 VLA 后训练 的人类数据选择作为推荐问题。对于每个机器人演示,SiMDex 采用三层召回-排名-重新排名流程,从约 3200 万以自我为中心的人类样本池中提取与任务相关的子集,在形态不可知的动作空间中运行,无需更改 VLA 架构或训练。与使用等量随机采样人类数据训练的强大基线相比,SiMDex 仅使用约 149 万个挖掘样本(< 池的 5%),但将总体成功率从 47.7% 提高到 61.1%,这表明选择性管理优于不加区别的数据混合。