论文
以 NRC 反应堆操作员执照考试为基准的多模态语言模型:微调 和检索策略
Multimodal Language Models Benchmarked Against the NRC Reactor Operator Licensing Examination: Fine-Tuning and Retrieval Strategies
摘要
当根据该领域已经执行的标准进行衡量时,安全关键领域中语言模型的能力声明是可信的。我们在美国核管理委员会反应堆操作员通用基础知识考试 (GFE) 中评估了一个开放权重 310 亿参数多模态模型 (Gemma 4 31B-IT),根据适用于每位考生的 80% 标准进行逐卷评分,不进行四舍五入。该评估集是对 2015 年至 2021 年 3 月举行的每次 GFE 的普查,给出了 7 篇压水堆 (PWR) 和 7 篇沸水堆 (BWR) 论文以及 697 个评分项目。跨越三个模型状态的八种配置,基本模型,基于蒸馏思想链原理的监督 微调 (SFT) 和检索增强的 微调 (RAFT),具有三种检索条件,即在固定大小和结构感知分块下对能源部基础手册进行无检索和 BM25 检索。开箱即用,它的正确率是 51.94%,并且没有通过试卷。具有固定大小分块检索的 SFT 通过了 14 次中的 8 次,PWR 项目达到 80.23%,池化达到 79.77%,Wilson 区间跨越阈值。首选的分块粒度与训练状态相反,微调 之前是结构感知的,之后是固定大小的,因此针对基本模型优化的分块不能由其微调的后代继承。 RAFT 总体落后 SFT 2.2 至 2.3 个百分点,并且在所有四个反应堆类型和分块层中均存在赤字。该管道在一台工作站上运行,运行时没有网络访问权限,其结果接近操作员级的工程基础知识,但无法可靠地实现。