用于决策关键型应用的多模态 LLM 中可解释且资源高效的空间推理
Explainable and Resource-Efficient Spatial Reasoning in Multimodal LLMs for Decision-Critical Applications
摘要
随着多模态 大语言模型 (MLLM) 越来越多地部署在机器人、嵌入式人工智能和安全监控等决策关键管道中,其空间判断的不透明性限制了操作员的信任和可审计性。 MLLM 表现出强大的推理能力,但常常难以进行细粒度的空间理解和物体幻觉。 ByDeWay 之前的工作引入了基于分层深度的提示 (LDP),这是一种 无需训练 框架,可通过使用单眼深度估计构建提示来减轻幻觉。然而,粗深度分层在解决同一几何平面内的对象到对象的空间关系方面存在不足,例如投影(“左侧”、“上方”)和拓扑(“内部”、“接触”)关系。我们提出了 ByDeWay-V2,它集成了明确的空间关系上下文和深度线索,表示为人类可读的谓词,作为下游决策支持的可审计证据。我们的框架使用开放词汇对象检测器 (YOLO-World-L) 计算检测到的对象之间的成对几何关系,并将它们作为结构化空间谓词注入 MLLM 提示中,无需任何训练即可桥接 3D 场景深度和 2D 空间语义。我们在多个 MLLM 的视觉空间推理 (VSR) 和 BLINK 基准上评估 ByDeWay-V2,并通过 POPE 评估幻觉与视觉依据对齐。在 BLINK 空间子集上,ByDeWay-V2 比 Qwen2.5-VL 的 LDP 实现了 46% 的相对 F1 改进,并将 BLIP-Base 在 VSR 上的空间推理从近随机性能恢复到具有竞争力的 F1 0.53。我们最轻的配置在 CPU 上严格的 40 个词元上下文预算下运行,表明该框架适用于资源受限的实时决策支持设置。