论文
Foundation CAN LM:面向汽车 CAN 数据的预训练语言模型
Foundation CAN LM: A Pretrained Language Model For Automotive CAN Data
摘要
控制器局域网(CAN)总线提供了丰富的车辆信号来源,日益被汽车与车险领域的应用所利用,包括碰撞检测、预测性维护与驾驶员风险建模。尽管潜力可观,现有流水线大多在原始 CAN 数据上训练孤立的任务专用模型,探索解码信号的尝试有限。这种碎片化阻碍了共享表征学习并限制跨任务泛化。相比之下,自然语言处理(NLP)与计算机视觉(CV)已被基础模型范式变革:大规模预训练加任务特定适配。本文提出基础 CAN 模型,用单一预训练骨干展示多目标下游泛化。我们的方法把 CAN 数据当作一种语言:在大规模无标注的解码 CAN 信号上预训练,再在异构车险任务上微调。为此,我们提出面向离散—连续混合信号的统一分词方案,并应对时间复杂度与行程特异性变异带来的挑战。结果表明,一个预训练 CAN 模型能够有效适配多样预测任务,验证了在 NLP 与 CV 中已被证明的基础建模范式同样适用于 CAN 数据。这为汽车 AI 中可泛化表征学习确立了新方向。
