论文

IndustryBench:探测LLM的工业知识边界

IndustryBench: Probing the Industrial Knowledge Boundaries of LLMs

模型评测基准与评测资源

摘要

在工业采购中,LLM的回答只有通过标准校验才有用:推荐材料必须匹配运行工况,每个参数都必须符合规定阈值,任何操作规程都不得与安全条款相抵触。部分正确可能掩盖安全关键性矛盾,而聚合式LLM基准很少能捕捉到这些矛盾。我们提出IndustryBench,一个包含2,049道题的中文工业采购问答基准,以中国国家标准(GB/T)和结构化工业产品记录为基础,按七个能力维度、十个行业类别和专家组标定的难度层级组织,并配有逐题对齐的英语、俄语和越南语版本。我们的构建流程在基于搜索的外部验证阶段拒绝了70.3%的LLM生成候选题,标定了仅靠LLM过滤后工业问答仍然不可靠的程度。我们的评估将原始正确性(由Qwen3-Max评审打分,与领域专家的一致性达$\kappa_w = 0.798$)与针对源文本的独立安全违规(SV)检查解耦。在中文的17个模型和四种语言的8模型交集上,我们发现:(i) 最佳系统在0–3评分量规上仅得2.083分,提升空间巨大;(ii) 标准与术语是最顽固的能力弱点,且在逐题对齐翻译后依然存在;(iii) 扩展推理降低了13个模型中12个的安全调整后得分,主要原因是更长的最终答案中引入了缺乏依据的安全关键细节;(iv) 安全违规率重新洗牌了排行榜——GPT-5.4经SV调整后从第6名升至第3名,而Kimi-k2.5-1T-A32B下降七位。因此,工业LLM评估需要基于源文本、具有安全意识的诊断,而非聚合准确率。我们发布IndustryBench,附带全部提示词、评分脚本和数据集文档。

IndustryBench:探测LLM的工业知识边界
图 1:IndustryBench 中国基准表现前 10 名(0-3 等级)。完整的 17 款车型排行榜请参见表 7。