论文

SciRisk-Bench:面向AI4Science安全的风险维度感知基准

SciRisk-Bench: A Risk-Dimension-Aware Benchmark for AI4Science Safety

模型评测安全与风险评测

摘要

大语言模型(LLM)日益嵌入AI for Science(AI4Science)工作流——从科学问答、文献分析到实验室规划与自主发现。这一进展迫切需要不仅评估科学能力——还评估模型是否在高压科学情境中识别并规避风险的安全基准。既有AI4Science安全数据集覆盖若干学科与任务格式——但底层风险维度欠明确。我们介绍SciRisk-Bench——从显式风险维度与科学学科两个互补视角评估AI4Science安全的基准。SciRisk-Bench覆盖7个学科、31个子学科与10个风险维度。在实验部分——我们跨风险维度、学科与子学科评估主流LLM与科学导向LLM——实现对科学模型何处仍不安全的细粒度诊断。

SciRisk-Bench:面向AI4Science安全的风险维度感知基准:论文配图
图 2:按风险维度划分的模型级 ASR 热图。列是单独的模型,行是风险维度;较暖的颜色表示较高的 ASR。左侧区块显示主流模型,右侧区块显示科学专用模型。