论文
前沿语言模型CBRN能力提升评估的阈值超越框架
A Threshold Exceedance Framework for CBRN Uplift Evaluation in Frontier Language Models
摘要
随着前沿语言模型进步,政策制定者与模型开发者需要方法评估:相对于仅用公开工具,模型访问是否实质提升非专家行动者规划高后果化学、生物、放射或核(CBRN)滥用的能力。既有CBRN评估在非专家定义、威胁范围、基线、评分量规与决策规则上各异——结果难以跨研究比较。我们提出阈值超越标准(TEC)框架:把提升研究分解为可独立执行的组件——确定非专家参与者资格、定义研究CBRN威胁范围、统计估计实质提升。随后我们以大规模实证研究把TEC框架操作化:设计区分两种提升形式——生成式(模型协助从零创建计划)与修订式(模型协助精炼既有计划)。研究产出跨CBRN域的攻击计划,经主题专家评审估计生成式与修订式提升。应用该框架,实证研究揭示域异质性:在此受控发布前评估下,模型辅助计划有时获得专家等同的教学性评分,但确认的实质提升限于放射域。这些发现为缓解与部署治理决策提供依据,而非刻画已部署模型的行为。我们以方法学教训作结:强调预先指定的标准、显式基线、生成式与修订式估计的分离、以及初步筛查信号与确认风险判定之间的谨慎区分。
