论文

FUSE:大语言模型危险能力评估框架

FUSE: An Evaluating Framework for Dangerous Capabilities of LLMs

模型评测安全与风险评测

摘要

碎片化的安全评估破坏了危险人工智能能力的治理。我们提出了一个模块化框架,通过三个正交管道——知识($K$)、防御($D$)和危害($H$)——在统一协议下评估每个模型,将结果聚合到标准化的危险能力概况$φ$中。可插拔模块提供场景种子、知识库、危险查询和判断量规,而核心评估引擎跨领域保持不变; CB 评估由展示协议传输的网络试点进行补充。我们使用化学生物 (CB) 模块实例化该框架,评估了来自 4 个系列的 12 名商业LLM。我们的第一个贡献是对不同模型和模型家族的危险能力进行横向比较:这三个维度揭示了截然不同的概况——具有可比知识的模型在拒绝弹性方面存在差异,强大的防御者在遵守规定时不会产生较少的有害内容——而家族层面的模式进一步区分了 Claude、DeepSeek 和 GPT 模型。第二个是能力演变的时间分析:根据模型发布日期跟踪 $K$、$D$ 和 $H$ 表明危险能力并没有单调下降;较新的模型加深了知识,但仅部分提高了防御能力,这表明扩展和调整的进展并不能统一转化为安全性。可靠性是通过跨评判一致性(引导 $ρ> 0.79$,5 个评判中的 4 个)和流程正交性($K$--$D$--$H$ 相互关系 $ρ\in [0.32, 0.52]$)建立的。

FUSE:大语言模型危险能力评估框架:论文配图
图2:框架结构概览:一个四模块系统(可穿透模块、任务管束、测试环境、判断),通过三个平行评估管道(KK、DD、HH)对每个模型进行评估,并将其汇总成危险的能力剖面图phi。