论文
DiagnosticIQ:基于符号规则的LLM工业维护动作推荐基准
DiagnosticIQ: A Benchmark for LLM-Based Industrial Maintenance Action Recommendation from Symbolic Rules
摘要
监控复杂的工业资产依赖于工程师编写的符号规则,这些规则根据传感器条件触发并提示技术人员执行纠正措施。瓶颈不是检测而是响应:将规则转化为维护步骤需要通过多年的实践获得特定于资产的知识。我们研究了LLM是否可以作为这一从规则到行动步骤的决策支持,并引入了 \ours{},这是一个由来自 16 种资产类型的 118 个规则-行动对的 6{,}690 个经过专家验证的多项选择问题组成的基准。我们贡献了 (i) 符号到 MCQA 管道规范化规则到析取范式,并具有基于嵌入的干扰采样,(ii) 探测不同故障模式的五种变体(Pro、Pert、Verbose、Aug、Rationale),以及 (iii) 29 个 LLM 和 4 个嵌入基线的基准。人工评估(9 位从业者,平均 45.0\%)证实,我们的{}需要超出操作经验的专业知识。三个发现很突出。边界已经关闭:前三名LLM都在一个宏观点内,Bradley-Terry Elo 将 claude-opus-4-6 比下一个模型高出 30 点。然而,Pro 暴露了脆弱性,每个模型在干扰扩展下都会损失 13--60% 的相对准确度。 \ours{}\,8 月公开了模式匹配:在条件反演下,前沿模型在 49--63\% 的时间内仍然选择原始答案。部署瓶颈不是能力而是校准:前沿模型可以处理模板式故障检测,但会在结构扰动下崩溃。