摘要
工业时间序列是预测与健康管理(PHM)的基础,确保航空发动机等工业设备的可靠性和安全性。然而,现有方法通常限于单一模态建模,这限制了其在复杂场景中的泛化能力。尽管近期大型语言模型(LLMs)的进展为多模态学习提供了新机会,但如何将连续时间序列信号与离散文本语义连接起来仍然是一个开放挑战。
为此,我们提出了 VLT,一个多模态基础模型,联合建模时间序列、频谱视觉表示和文本知识。关键点在于利用频谱作为桥梁,将连续的时间信号与离散语义连接起来。具体来说,设计了一个时间感知的专家混合模型(Time-MoE),用于捕捉异构时间动态。同时,引入了频谱-文本增强学习器,以便在共享表示空间内联合建模频谱和语义特征。此外,提出了一种以时间为中心的梯度对齐机制,通过梯度归一化和可靠性感知的动态重加权来缓解跨模态优化冲突。
在多个工业数据集上的广泛实验表明,VLT 超越了最先进的方法,在少样本、噪声和不完整模态设置下实现了更强的鲁棒性和泛化能力。
博主点评: VLT 模型通过结合时间序列和视觉信息,打破了传统单模态方法的局限,展示了多模态学习在工业智能中的巨大潜力。其创新的时间感知机制与动态重加权策略为跨模态学习提供了新的思路,值得深入研究和应用。