工业指令:用于根据工业技术报告构建指令调优和基准数据集的端到端框架
Industrial-Instruction: An End-to-End Framework for Building Instruction-Tuning and Benchmark Datasets from Industrial Technical Reports
摘要
工业技术报告包含维护、故障排除和产品工程的高价值知识,但其异构结构(密集的散文、规范、表格)使得它们难以通过标准检索和质量保证管道进行索引和推理,并且没有从此类文档构建公共指令调整或基准数据集。我们通过工业指导解决了这一差距,贡献了(i)根据真实工业技术报告构建的两个开放的质量保证数据集和(ii)生成它们的端到端管道。使用 906 个公开的 Panasonic 文档(7,525 页),我们应用布局感知提取,构建语义检索索引,并综合基于五种查询文档关系(不相关检索、单/多文档支持、单/多文档答案)下检索到的证据的多项选择 QA。在过滤初始 23.9k 生成的样本后,每个数据集提供大约 13.6k QA 对以及源文档和保留的基准分割。 微调 小开 LLM(在 10B 参数下)将 Panasonic 基准测试中的设置匹配精度从 28.5% 提高到 42.0%,F1 从 46.6% 提高到 63.5%。我们发布了由同一管道构建的两个并行版本:一个使用开放权重 Qwen3-30B-A3B-Instruct 模型生成,另一个使用基于 API 的封闭式 Claude-Opus-4.6 模型生成,从而可以直接比较开放模型与前沿模型数据生成。 Claude-Opus-4.6 数据集产生更干净的原始语料库和更大的 微调 增益,但成本大约高出两个数量级。 MMLU 评估显示,在 Claude-Opus-4.6 数据上训练的模型基本上保留了所有常识,而 Qwen 生成的数据的遗忘效应虽小但可测量。这些数据集和管道共同提供了一条实用的、可重复的路径,从现实世界的文档中获取可扩展的工业基准和训练数据。