论文

语义有限的表格数据上的 LLM:来自工业汽车改装预测的证据

LLMs on Tabular Data with Limited Semantics: Evidence from Industrial Car Retrofit Prediction

模型评测模型能力评测

摘要

工业改造规划取决于结构化操作数据而不是自由文本:规划人员必须估计新注册的原型是否需要改造、需要哪个改造包以及工作需要多长时间。我们研究了一个将原型注册系统(284,271 辆车辆)与改造管理系统(48,716 次清理访问)链接起来的工业数据集,并将强大的表格机器学习基线与行序列化输入上的三种基于 LLM 的策略进行比较:嵌入特征 (Amazon Titan)、直接提示分类 (Claude Sonnet 4) 和 ML+LLM 堆叠方法。在二元发生预测、15 路改造类型分类、每次访问持续时间回归和每月汇总基准方面,经典树集成仍然是最强的独立模型。然而,LLM 结果揭示了一致的模式:嵌入在表上仍然有用(二进制 AUC = 0.982),一旦语义信号被散列剥离(二进制 AUC = 0.500;多类加权 F1 = 0.018),直接提示就会崩溃,而混合堆叠产生最佳的手动构建的多类模型(加权 F1 = 0.626)。在每月基准测试中,基于滞后的机器学习优于时间序列基础模型,尽管 Chronos-small 在零样本预测方面仍然具有竞争力。结果表明,在隐私受限的工业表格上,LLM 作为补充组件比作为强表格基线的替代品更有效。