论文
NuclearQAv2:大语言模型 中评估领域科学能力的结构化基准
NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models
摘要
大语言模型 (LLM) 在广泛的任务中表现出了强大的性能,但确保其在高科技领域的可靠性仍然是一个重大挑战。在核工程中,解决问题通常不仅需要事实知识,还需要定量推理和概念理解。为了满足该领域系统评估的需求,我们引入 NuclearQAv2,这是评估 LLM 核工程知识的基准。该基准包含大约 1,240 个问答对,涵盖三个类别:布尔型、数字型和语言型。 NuclearQAv2 使用混合管道构建,该管道结合了专家编写的问题、现有数据集和 LLM 辅助生成的特定领域技术语料库。通过利用结构化提示进行自动问题生成和响应评估,所提出的框架可以实现可扩展的基准构建和评估。我们使用 NuclearQAv2 评估不同的 LLM 集,并观察任务类型之间的显着性能差异。虽然这些模型通常在事实问题上表现良好,但定量推理和概念理解仍然更具挑战性。这些结果凸显了多方面评估框架的重要性,并将 NuclearQAv2 确立为评估技术领域 LLM 能力的可扩展基准。