DART:用于综合绳索状态监测的视觉语言基础模型
DART: A Vision-Language Foundation Model for Comprehensive Rope Condition Monitoring
摘要
用于近海、海上和工业环境的合成纤维绳索 (SFR) 的状态监测 (CM) 需要的不仅仅是分类器:检查人员需要连续的严重性估计、维护建议、异常标记、恶化时间表和自动报告,所有这些都来自单个检查图像。我们推出了 DART(通过绳索 Transformer 进行损伤评估),这是一种视觉语言基础模型,可通过统一的多任务架构解决完整的绳索检查工作流程。 DART 通过严重性条件跨模态融合 (SC-CMF) 模块将 Vision Transformer (ViT-H/14) 与 Llama-3.2-3B-Instruct 耦合,从而将联合嵌入预测架构 (JEPA) 扩展到跨模态域。三个架构创新推动了模型的多功能性:(1)HD-MASK,一种显着性引导的掩蔽策略,专注于对损伤密集斑块进行自我监督重建; (2) 每类可学习的严重性门,根据损害类别自适应地对语言基础进行加权; (3) 对比损伤解缠 (CDD) 损失,它塑造嵌入空间以同时编码损伤类型、严重性排序和跨模态语义。在涵盖 14 个细粒度绳索损坏类别的 4,270 张图像上进行一次训练后,冻结的 DART 主干支持下游任务,无需任何特定于任务的 微调:损坏分类(93.22% 准确度、91.04% 宏 F1、+38.5 pp 超过仅视觉基线)、连续严重性回归(Spearman rho = 0.94,1 序数精度内) 99.6 %),少镜头识别(20 次拍摄时的微距 F1 为 89.2 %)。这些结果表明,DART 作为通用 CM 主干网发挥作用,其功能远远超出了分类范围,可以通过单一共享表示提供可操作的检查情报。