论文
VLT:面向工业智能的视觉—语言—时序多模态基础模型
VLT: A Vision-Language-Time Series Multimodal Foundation Model for Industrial Intelligence
摘要
工业时序是预测性健康管理(PHM)的基础——保障航空发动机等工业设备的可靠与安全。但既有方法通常局限于单模态建模,限制其在复杂场景的泛化。尽管大语言模型(LLM)的近期进展为多模态学习提供新机会,桥接连续时序信号与离散文本语义仍是开放挑战。为此我们提出VLT:一个联合建模时序、频谱视觉表示与文本知识的多模态基础模型。关键洞见是利用频谱作为视觉桥梁——连接连续时间信号与离散语义。具体地,设计时间感知混合专家(Time-MoE)捕捉异构时间动态,频谱—文本增强学习器在共享表示空间内联合建模频谱与语义特征;进一步引入以时间为中心的梯度对齐机制——经梯度归一化与可靠性感知动态重加权缓解跨模态优化冲突。多工业数据集上的大量实验显示VLT超越最先进方法——在少样本、含噪与不完整模态设定下取得更优的鲁棒性与泛化。
