论文

AssemLM:用于机器人装配的空间推理多模态 大语言模型

AssemLM: A Spatial Reasoning Multimodal Large Language Model for Robotic Assembly

摘要

空间推理是体现智能的一项基本能力,尤其是对于机器人装配等细粒度操作任务。最近基于视觉语言模型 (VLM) 的方法很大程度上依赖于粗略的 2D 感知,并且很难对复杂的 3D 几何形状进行准确的推理。为了解决这一限制,我们提出了 AssemLM,这是一种用于机器人装配的空间多模态 大语言模型,它集成了装配手册、点云和文本指令,以通过明确的几何理解来预测任务关键型 6D 装配姿势。为了连接原始 3D 感知和高级语言推理,AssemLM 采用专门的点云编码器来提取细粒度的几何和旋转特征,以便在装配任务中进行精确的 3D 空间推理。此外,我们还推出了 AssemBench,这是面向装配的空间推理的大型基准,具有超过 900K 多模态样本和精确的 6D 姿态注释,将评估从 2D 基础扩展到完整的 3D 几何推理。大量实验和真实机器人评估表明,AssemLM 实现了最先进的 6D 位姿推理性能,并有效支持现实环境中的细粒度、多步骤装配任务。代码、模型和 AssemBench 数据集将公开。