论文
WuYuEval:固体废物管理大语言模型的多级基准
WuYuEval: A Multi-Level Benchmark for Large Language Models in Solid Waste Management
摘要
大语言模型 (LLM) 越来越多地被用作技术助理,但他们在固体废物管理 (SWM) 方面的能力仍然难以评估,因为现有基准强调一般知识,而不是工程、环境和政策约束下的专业决策。我们介绍 WuYuEval,这是一个多级基准,用于评估 SWM 中的 LLM 的基础知识、领域推理和专家决策。经过质量审核后,WuYuEval 包含一个基础模块,其中包含 6 个任务类型和 8 个领域类别的 4,590 个封闭式多项选择问题,以及一个专家模块,其中包含 247 个基于场景的开放式问题,涉及多目标优化、约束权衡和系统设计。对于专家任务,我们将锚定校准的 LLM-as-a-Judge 评分与基于 Elo 的成对比较相结合。在 33 个 LLM 中,性能差异很大。领先模型在基础模块上达到了 94.64% 的准确率,但平均准确率仍然从简单问题的 84.14% 下降到困难问题的 42.50%,表现较低的集中在计算、实验设计、城市规划和开放式专家任务上。面向推理的思维模式在审核后改善了大多数匹配的模型对,但收益取决于基线能力,并且并不都是积极的。这些结果表明,可见的深思熟虑只有在锚定于单位、假设和工程约束时才有帮助;否则,它可能会偏离决定性答案的边界。 WuYuEval因此为开发具有专业推理链和显式约束控制的面向SWM的基础模型提供了评估资源和经验基础。