论文
面向基于LLM的工业健康智能的工业分词:工业证据集成的联邦架构
Industrial Tokenization for LLM-Based Health Intelligence: A Federated Architecture for Industrial Evidence Integration
摘要
工业健康管理日益依赖异构信息源,包括状态监测系统、监控与数据采集(SCADA)系统、维护记录、检测结果和预测性模型。尽管大语言模型为跨源推理提供了新机遇,但工业数据和分析输出在结构、时间分辨率、物理含义与可靠性方面差异巨大。将此类异构信息直接集成到单一整体模型中,可能降低可解释性、可追溯性以及对设备与数据变化的适应性。本文提出工业分词(Industrial Tokenization),一种概念性接口,将特定来源的分析输出转化为结构化、机器可解释的工业证据单元,称为 Industrial Token。与用于编码原始时间序列数据的数值 token 不同,Industrial Token 表示有领域依据的证据,并附带来源、时间范围、运行上下文、分析含义、质量或置信度信息以及出处。基于这一概念,本文提出一种联邦式工业架构:异构分析子系统保持自主,同时向中央推理层暴露标准化的 Industrial Token。作为初始实现,本研究提出一条基于振动诊断输出、基于规则的事件聚合、结构化文本 token 生成和基于 LLM 的解释的端到端 DiagnosisToken 通路。其他 Industrial Token,包括基于 SCADA 的状态监测 token、维护 token 和预测 token,留作未来扩展。所提框架将工业分词定位为特定领域工业智能与基于 LLM 或智能体的推理之间的语义接口,而非又一种编码原始工业数据的方法。
