论文
通过 LLM Backbones 进行高效、自适应的人类活动识别
Efficient and Adaptive Human Activity Recognition via LLM Backbones
摘要
人类活动识别 (HAR) 是普适计算系统中的一项核心任务,其中模型必须在严格的计算约束下运行,同时对异构和不断变化的部署条件保持鲁棒性。基于 Transformer 架构的最新进展显着提高了识别性能,但通常依赖于从头开始训练的特定于任务的模型,导致训练成本高、数据需求大以及对领域转换的适应性有限。在本文中,我们提出了一种范式转变,即重用大型预训练语言模型 (LLM) 作为基于传感器的 HAR 的通用时间主干,而不是设计特定领域的 Transformer。为了弥合惯性时间序列和语言模型之间的模态差距,我们引入了结构化卷积投影,将多元加速度计和陀螺仪信号映射到 LLM 的潜在空间。预训练的骨干网保持冻结状态,并使用参数高效的低秩适应 (LoRA) 进行调整,大大减少了可训练参数的数量和总体训练成本。通过对标准 HAR 基准的大量实验,我们表明这种方法可以实现快速收敛、强大的数据效率和强大的跨数据集传输,特别是在低数据和少样本设置中。同时,我们的结果强调了卷积前端和 LLM 的互补作用,其中局部不变性在信号级别处理,而远程时间依赖性由预训练的主干捕获。总的来说,这项工作表明 LLM 可以作为自适应 HAR 系统的实用、节俭和可扩展的基础,为在原始语言领域之外重用基础模型开辟新的方向。