论文
当LLM超越诊断工具时:工业故障诊断中未实现的互补性
When LLMs Sit Above Diagnostic Tools: Unrealized Complementarity in Industrial Fault Diagnosis
摘要
大语言模型越来越多地用作专用工具之上的集成层,但更强大的组件并不一定会产生更强大的组合系统。通过五个诊断数据集(轴承振动、过程监控、半导体设备),我们研究LLM是否可以可靠地使用外部诊断信息;配对重复调用将建议效果与输出不稳定分开。在这五个案例中,相互矛盾的外部信息推翻了最初正确的LLM判断。在进行直接集成比较的四个数据集中,没有一个数据集显示出隐式LLM集成相对于更强大的独立源具有一致的优势。在田纳西州 Eastman 确认集上,其协议在评估前已确定,无辅助准确率为 64.67%,隐式LLM-专家集成为 77.43%,单独专家为 83.33%。专家信息将LLM提高了 12.8 点(95% 区间 9.7 至 15.9),但综合输出仍然比专家低 5.9 点(95% 区间 -12.0 至 -0.7)。双源选择器预言机达到92.76%,说明综合输出没有完全实现互补。综合输出错过了 295 个专家更正中的 140 个 (47.5%),但丢失了 99 个最初正确的LLM判断中的 15 个 (15.2%)。在及时和专业的敏感性分析中,赤字仍然存在。在两种证据呈现下解决的 CWRU 案例中,与任务相关的物理证据在七个模型中的六个模型中对错误建议的敏感性较低(五个间隔,不包括零);更高的推理工作没有可靠地减少五个模型,并且单独的四模型 TEP 分析没有提供明确的证据表明它解决了集成问题。源质量和集成质量应单独评估:集成层应与其更强大的独立组件进行比较,而不仅仅是与独立的LLM进行比较。
