论文

Foundation CAN LM:面向汽车 CAN 数据的预训练语言模型

Foundation CAN LM: A Pretrained Language Model For Automotive CAN Data

模型训练预训练

摘要

控制器局域网(CAN)总线提供了丰富的车辆信号来源,日益被汽车与车险领域的应用所利用,包括碰撞检测、预测性维护与驾驶员风险建模。尽管潜力可观,现有流水线大多在原始 CAN 数据上训练孤立的任务专用模型,探索解码信号的尝试有限。这种碎片化阻碍了共享表征学习并限制跨任务泛化。相比之下,自然语言处理(NLP)与计算机视觉(CV)已被基础模型范式变革:大规模预训练加任务特定适配。本文提出基础 CAN 模型,用单一预训练骨干展示多目标下游泛化。我们的方法把 CAN 数据当作一种语言:在大规模无标注的解码 CAN 信号上预训练,再在异构车险任务上微调。为此,我们提出面向离散—连续混合信号的统一分词方案,并应对时间复杂度与行程特异性变异带来的挑战。结果表明,一个预训练 CAN 模型能够有效适配多样预测任务,验证了在 NLP 与 CV 中已被证明的基础建模范式同样适用于 CAN 数据。这为汽车 AI 中可泛化表征学习确立了新方向。

Foundation CAN LM:面向汽车 CAN 数据的预训练语言模型
图2:混合模式 CAN 信号的统一分词流水线。解码后的 CAN 数据被拆分为离散变量(符号型与枚举型)和连续变量,经由特定类型的策略处理,然后合并为用于预训练的统一 token 词表。