论文

前沿语言模型CBRN能力提升评估的阈值超越框架

A Threshold Exceedance Framework for CBRN Uplift Evaluation in Frontier Language Models

模型评测安全与风险评测

摘要

随着前沿语言模型进步,政策制定者与模型开发者需要方法评估:相对于仅用公开工具,模型访问是否实质提升非专家行动者规划高后果化学、生物、放射或核(CBRN)滥用的能力。既有CBRN评估在非专家定义、威胁范围、基线、评分量规与决策规则上各异——结果难以跨研究比较。我们提出阈值超越标准(TEC)框架:把提升研究分解为可独立执行的组件——确定非专家参与者资格、定义研究CBRN威胁范围、统计估计实质提升。随后我们以大规模实证研究把TEC框架操作化:设计区分两种提升形式——生成式(模型协助从零创建计划)与修订式(模型协助精炼既有计划)。研究产出跨CBRN域的攻击计划,经主题专家评审估计生成式与修订式提升。应用该框架,实证研究揭示域异质性:在此受控发布前评估下,模型辅助计划有时获得专家等同的教学性评分,但确认的实质提升限于放射域。这些发现为缓解与部署治理决策提供依据,而非刻画已部署模型的行为。我们以方法学教训作结:强调预先指定的标准、显式基线、生成式与修订式估计的分离、以及初步筛查信号与确认风险判定之间的谨慎区分。

前沿语言模型CBRN能力提升评估的阈值超越框架:论文配图
图 1:SME 标注的对照组和治疗组之间指标值的差异。每个单元格显示生成 (G) 和修正 (R) 条件的差异。颜色表示风险级别:满足审核阈值、低于但接近阈值、以及低于阈值。 *** 表示根据所选统计测试,指标具有统计显着性。仅当 G 和 R 均具有统计显着性且差异比例为度量范围的 >10%>10\% 时,单元格才会呈红色。阈值状态指示指标是否满足研究预先指定的审查标准。它并不表明攻击计划是可执行的,发生了任何现实世界的尝试,或者评估的模型在没有防护措施的情况下可用。