论文

通过视觉-语言模型实现辅助空间认知

Assisted Spatial Cognition Through Vision-Language Models

应用与实践个人助理

摘要

多模态AI借助大语言模型(LLMs)和视觉-语言模型(VLMs),实现对视觉与文本数据的同步处理,为全球4300万视障及神经多样性人群提供支持。这些人群因空间感知不足和环境线索匮乏,在室内室外环境中面临持续导航困难。现有导航辅助工具通常缺乏对三维场景的全面理解,依赖于受限的路径导向策略,限制了用户自主性。本文提出一种端到端框架,融合LLMs、VLMs与数字孪生技术,为视障及神经多样性用户提供空间认知导航支持。系统通过标准手机摄像头采集视频输入,并利用SLAM3R从单目RGB序列中实时生成密集3D点云。我们设计的自定义后处理算法确保多视角下点云对齐的准确性,无需预先设定参考点。该方法提升了SpatialLM生成结构化3D表示的能力,包括建筑元素和带方向的对象边界框。经过丰富后的空间数据由本地部署的LLM处理,解析3D场景以生成详细场景描述和用户与周围物体之间的精确距离测量。我们在包含多种视角、循环行走视图及多环境场景的视频数据上进行了评估,结果表明系统在3D场景理解与物体定位方面保持一致的准确性,验证了该系统作为融合先进视觉感知与空间推理的辅助导航解决方案的潜力。

通过视觉-语言模型实现辅助空间认知:论文配图
图 1:该图表示使用移动相机、SLAM 应用程序的预训练模型、数据对齐和缩放的后处理来生成干净且高质量的点云的过程。