论文
使用多模态 大语言模型 从几何标签到室内建筑组件的语义理解
From Geometric Labels to Semantic Understanding of Indoor Building Components Using Multimodal Large Language Models
摘要
基于点云的理解已成为涉及室内建筑组件的设施运营和维护的重要推动因素。然而,现有方法仅输出离散标签,而没有解释组件功能或自然语言交互。本文提出了 Building-MLLM,这是一种用于室内组件的以点云为中心的多模态 大语言模型 (MLLM),它对点云和指令进行建模,以生成跨简单识别、复杂字幕和多工程问答任务的响应。 Building-MLLM 通过四种特定于领域的机制解决语义集中问题:用于任务相关语义的点信息增强器、防止几何侵蚀的几何保留正则化、用于领域稳定的固定文本前缀以及平衡识别与推理的多维 LoRA。开发了多约束渐进指令生成引擎来编译包含 4198 个对象、37,782 个指令跟踪对和 47 个类别的合成点云文本数据集。实验表明,Building-MLLM 在三种任务类型上分别实现了 88.00%、65.10% 和 68.14%,展示了卓越的室内组件语言理解能力,并为其他现实世界数据集的迁移推理提供了初步的泛化能力。