论文

ViSRA:基于视频的多模态空间推理代理 大语言模型

ViSRA: A Video-based Spatial Reasoning Agent for Multi-modal Large Language Models

智能体系统Agent 架构与控制循环

摘要

多模态 大语言模型 (MLLM) 的最新进展以 3D 空间智能为目标,但这一进展很大程度上是由 后训练 在策划的基准上推动的,使得推理时间方法的探索相对不足。在本文中,我们从 无需训练 的角度出发,介绍 ViSRA(一种基于视频的人类对齐空间推理代理)作为探索 MLLM 空间推理机制的框架。 ViSRA 通过利用专家模型中的显式空间信息,以模块化和可扩展的方式引发空间推理,从而实现即插即用的灵活范例。 ViSRA 具有两个关键优势:(1) 人性化且可转移的 3D 理解,而不是针对特定任务的过度拟合; (2) 没有 后训练 计算成本以及空间推理数据集的大量手动管理。实验结果表明,一组 MLLM 在现有基准和未见过的 3D 空间推理任务上都有一致的改进,其中 ViSRA 的绝对性能分别比基准高出 15.6% 和 28.9%。