论文
SciHazard:用分解式危害评分测量科学安全风险的基准
SciHazard: A Benchmark for Measuring Scientific Safety Risks with Decomposed Harm Scoring
摘要
大语言模型(LLM)日益支持科学研究,但也可能把危险的科学知识转化为可操作的滥用指引。现有基准常依赖与现实危害脱节的模板化查询,并采用缺乏领域落地的LLM即裁判范式。为此我们提出SciHazard,一个扎根真实世界的科学风险基准与数据集无关的危害性测量评估框架。SciHazard含12个学科的2,400个危害问题与600个过度安全问题,查询均落在受监管实体与有记录的失败场景上。为计算DeHarm-Score,我们开发分解式评估程序:组合查询危害严重度、拒绝行为与响应级风险;对未拒绝的响应,进一步把响应级危害分解为可执行性(经带重要性加权的动态清单量化)与净新增风险(经检索增强的论断抽取与合成屏障验证评估)。专家验证研究显示,DeHarm-Score较最强基线把与专家标注的一致性提升90.17%。我们在广泛的科学安全评估中对31个前沿LLM与深度研究智能体做基准测试。值得注意的是,深度研究智能体的平均DeHarm-Score比标准LLM高32.3%,暴露自主智能体是当前安全防御的关键盲区。代码与数据集见https://anonymous.4open.science/r/DeharmScore-7B55。
