论文

面向基于LLM的工业健康智能的工业分词:工业证据集成的联邦架构

Industrial Tokenization for LLM-Based Health Intelligence: A Federated Architecture for Industrial Evidence Integration

上下文与知识上下文工程

摘要

工业健康管理日益依赖异构信息源,包括状态监测系统、监控与数据采集(SCADA)系统、维护记录、检测结果和预测性模型。尽管大语言模型为跨源推理提供了新机遇,但工业数据和分析输出在结构、时间分辨率、物理含义与可靠性方面差异巨大。将此类异构信息直接集成到单一整体模型中,可能降低可解释性、可追溯性以及对设备与数据变化的适应性。本文提出工业分词(Industrial Tokenization),一种概念性接口,将特定来源的分析输出转化为结构化、机器可解释的工业证据单元,称为 Industrial Token。与用于编码原始时间序列数据的数值 token 不同,Industrial Token 表示有领域依据的证据,并附带来源、时间范围、运行上下文、分析含义、质量或置信度信息以及出处。基于这一概念,本文提出一种联邦式工业架构:异构分析子系统保持自主,同时向中央推理层暴露标准化的 Industrial Token。作为初始实现,本研究提出一条基于振动诊断输出、基于规则的事件聚合、结构化文本 token 生成和基于 LLM 的解释的端到端 DiagnosisToken 通路。其他 Industrial Token,包括基于 SCADA 的状态监测 token、维护 token 和预测 token,留作未来扩展。所提框架将工业分词定位为特定领域工业智能与基于 LLM 或智能体的推理之间的语义接口,而非又一种编码原始工业数据的方法。

面向基于LLM的工业健康智能的工业分词:工业证据集成的联邦架构:论文配图
图 1:工业词元化的联合工业架构。异构工业数据由自主分析子系统处理并转换为工业词元,然后提供给基于 LLM 的中央融合层。实线路径表示已实现的端到端 DiagnosisToken 路径,而虚线路径表示未来的分析子系统和工业令牌扩展。