论文

最后:利用工具作为提示来增强多模态的空间推理 大语言模型

LAST: Leveraging Tools as Hints to Enhance Spatial Reasoning for Multimodal Large Language Models

智能体系统Agent 工具调用

摘要

空间推理是智能系统感知物理世界并与之交互的基础能力。然而,多模态 大语言模型 (MLLM) 在解析复杂的几何布局时经常会出现幻觉和不精确。由于数据驱动的扩展难以内化结构化几何先验和空间约束,因此集成成熟的专业视觉模型提供了一种引人注目的替代方案。尽管前景广阔,但将该范式应用于空间推理却受到两个关键挑战的阻碍:调用异构、参数丰富的工具的困难,以及在高级推理中理解和有效利用其多样化的底层输出(例如,分割掩模、深度图)的挑战。为了应对这些挑战,我们提出了 LAST,一个用于工具增强空间推理的统一框架。 LAST 具有可扩展的交互式沙箱,称为 LAST-Box,它将异构工具调用抽象为原子指令和可重用的空间技能,返回可由 LLM 直接使用的多模式提示(例如带注释的图像和文本描述)。我们进一步设计了一个三阶段渐进训练策略,指导模型从理解工具输出到熟练且自适应的工具调用。对四个数据集的实验表明,LAST-7B 的性能比其主干网提高了约 20%,并且优于强大的专有闭源 LLM,大大增强了复杂空间任务的推理能力。