论文
通过可组合的基础先验和可推广的抓取合成进行自适应视觉语言抓取
Adaptive Vision-Language Grasping via Composable Foundation Priors and Generalizable Grasp Synthesis
摘要
本文提出了 AdaRoboVLG,这是一种任务自适应视觉-语言-抓取 (VLG) 框架,支持跨不同机器人手的通用抓取合成。与将基础模型与端到端抓取策略紧密耦合的现有 VLG 方法不同,AdaRoboVLG 学习一种有效的可泛化基础策略,该策略通过显式运动学映射和基于力闭合的稳定性估计来生成和评估物理上可行的抓取候选对象,同时将任务相关的理解卸载到专门的基础模型模块。这些模块提供了可组合的先验,可集成到掌握合成过程中,从而实现上下文自适应掌握合成,而无需重新训练底层掌握策略。通过广泛的模拟和现实世界的实验,我们证明了(i)基本策略表现出高效的学习和强大的跨手泛化,(ii)该框架有效地结合了空间、认知和时间先验,以解决三个代表性的抓取挑战,与最先进的方法相比,在不影响抓取合成性能的情况下,以及(iii)这些先验可以联合运行,以在杂乱和动态的环境中实现功能性抓取。这些结果表明,将物理抓取合成与任务相关的理解分离,为机器人抓取提供了一个可扩展的范式,允许基础模型的未来进步直接转化为改进的抓取能力,而无需重新设计或重新训练底层抓取策略。补充视频可在 https://adarobovlg.github.io/ 获取