论文
FORGE:制造场景的细粒度多模式评估
FORGE: Fine-grained Multimodal Evaluation for Manufacturing Scenarios
摘要
制造业越来越多地采用多模态 大语言模型 (MLLM),从简单感知过渡到自主执行,但当前的评估未能反映现实制造环境的严格要求。数据稀缺和现有数据集中缺乏细粒度的领域语义阻碍了进展。为了弥补这一差距,我们引入了 FORGE。我们首先构建一个高质量的多模态数据集,该数据集结合了真实世界的 2D 图像和 3D 点云,并用细粒度的域语义(例如,精确的模型编号)进行注释。然后,我们评估了 18 个最先进的 MLLM,涵盖三个制造任务,即工件验证、结构表面检查和装配验证,揭示了显着的性能差距。与传统理解相反,瓶颈分析表明视觉基础并不是主要限制因素。相反,缺乏特定领域的知识是关键瓶颈,为未来的研究设定了明确的方向。除了评估之外,我们还表明,我们的结构化注释可以作为可行的训练资源:在我们的数据上,紧凑的 3B 参数模型的监督 微调 在保留制造场景的准确性方面相对提高了 90.8%,为实现领域适应制造 MLLM 的实用途径提供了初步证据。代码和数据集可在 https://ai4manufacturing.github.io/forge-web 上获取。