论文

工程推理与指令(ERI)基准:面向基础模型与智能体的大型分类学驱动数据集

Engineering Reasoning and Instruction (ERI) Benchmark: A Large Taxonomy-driven Dataset for Foundation Models and Agents

模型评测基准与评测资源

摘要

工程推理与指令(Engineering Reasoning and Instruction, ERI)基准是一个分类学驱动的指令数据集,用于训练和评估具备工程能力的大语言模型(LLM)与智能体。数据集覆盖九个工程领域(土木、机械、电气、化学、环境、航空航天、材料、消防与工业工程)与55个子领域,并与七种意图类型(定义、解释、计算、比较、设计/综合、故障排查、代码相关)和三个难度层级(本科、研究生、专业)交叉,共得57,750条记录,附领域/子领域/类型/难度元数据与解答格式。我们用七个LLM检验ERI,报告了统计显著的三档性能结构:前沿模型(GPT-5、Claude Sonnet 4、DeepSeek V3.1)在五分制上平均得分超过4.30,而中档与更小模型的失败率递增,在研究生级问题上性能下降更陡。为化解LLM基准固有的循环性问题,我们开发了汇聚验证协议,利用跨提供商独立性、多评审员平均与前沿模型一致性分析,把幻觉风险实证限定在1.7%。ERI随分类规范、验证脚本与评估框架一同发布,以支持工程场景中指令微调、路由、检索增强评估与Agentic工具使用工作流的可复现比较与回归测试。