论文

Brick-Composer:使用MLLM进行多种积木的组装

Brick-Composer: Using MLLMs for Assembly with Diverse Bricks

摘要

我们梦想人工智能代理能够读取任意设计并从可重复使用的构建块构建现实世界的对象。作为实现这一愿景的第一步,我们研究多模态大语言模型(MLLM)是否具备积木组装所需的视觉基础和空间推理能力。我们将砖块组装制定为一个顺序决策问题,其中每个步骤都涉及两个子任务:砖块选择,从候选组件中识别目标砖块,以及砖块姿势估计,预测所选砖块应放置在何处以及如何放置。为了支持这项研究,我们引入了 BC-Bench(砖块施工基准),这是第一个评估 MLLM 与不同砖块组装的基准。实验表明,当前最先进的 MLLM 距离可靠的构建者还很远,难以选择细粒度的砖块,并且无法进行精确的姿态估计。为了弥补这一差距,我们提出了 Brick-Composer,这是一个学习框架,通过三个互补信号为 MLLM 提供组装技能:人类设计火花,提供丰富的施工演示;世界反馈,根据视觉和身体后果预测行动;综合体验,将学习扩展到现有的对象设计之外。 Brick-Composer 将积木选择准确度提高了三倍以上,大幅减少了姿态估计误差,并将严格的步骤级装配成功率从不到 1% 提高到了 15% 左右。经过训练,Qwen-3-8B 可以正确地组成一个完整物体的高达 42% 的步骤,这表明 MLLM 可以通过有针对性的、基于物理的学习来获得组装能力。

Brick-Composer:使用MLLM进行多种积木的组装:论文配图
图 1:BC-Bench 任务设置概述。左:砖块选择。该模型使用手动图像从候选网格中选择所需的砖块。右:砖块姿势估计。给定手动上下文、当前装配状态和选定的砖块,模型将砖块的目标姿势预测为平移向量和旋转矩阵。