论文

一起看:多机器人协作自我中心空间推理与多模态 大语言模型

Seeing Together: Multi-Robot Cooperative Egocentric Spatial Reasoning with Multimodal Large Language Models

模型评测基准与评测资源

摘要

多模态 大语言模型 (MLLM) 在以自我为中心的视频理解方面取得了实质性进展,但它们从多个具体观点进行协作推理的能力在很大程度上仍未得到探索。我们通过多机器人协作动态空间推理来研究这个问题,其中模型必须通过集成来自移动机器人团队的同步自我中心视频来回答空间、时间、可见性和协调问题。为了支持这种设置,我们引入了 CoopSR(该任务的第一个基准)以及 EgoTeam(一个多机器人自我中心 QA 数据集)。 EgoTeam 在 Habitat 和 iGibson 中包含 114,227 个 QA 对,涵盖 19 个问题类型、四个难度等级和三个团队规模,以及使用两个四足机器人收集的约 2,326 个 QA 的真实测试集。我们进一步提出了 SP-CoR(光谱和物理信息协作推理器),这是一种用于细粒度协作空间推理的 MLLM 框架。 SP-CoR 结合了动态感知多机器人帧采样、光谱和物理引导视图融合以及物理对齐提示 蒸馏,使模型能够在训练期间受益于特权机器人姿势监督,同时在测试时只需要以自我为中心的视频。在 22 个 MLLM 基线中,SP-CoR 持续改进了合作推理,在 Habitat 上比最强的微调基线高出 +3.87%,在 iGibson 上高出 +7.12%。它还对看不见的团队规模和现实世界的机器人测试表现出更强的概括性。代码可以在 https://github.com/KPeng9510/seeing-together.git 找到。