论文

TRACE:面向大型推理模型安全评测的证据支撑基准

TRACE: An Evidence-Grounded Benchmark for Safety Evaluation of Large Reasoning Models

模型评测基准与评测资源

摘要

大型推理模型(LRM)会生成中间推理轨迹,即使其最终回复看起来安全,这些轨迹也可能包含不安全内容。护栏模型旨在检测并拦截不安全内容,但现有的不安全内容检测基准主要关注提示词和最终回复,推理轨迹在很大程度上未被检验。此外,这些基准通常只提供二元安全标签,缺乏支撑判断的证据标注。为弥补这些不足,我们提出TRACE,一个覆盖LLM完整推理流程(提示词、推理轨迹和最终回复)的证据支撑安全评测基准。TRACE包含两种语言、覆盖九个风险类别和十种攻击策略的提示词。对每个提示词,由四个LRM生成推理轨迹和最终回复,我们为每个组件标注安全性,并从相应源文本中提取支撑证据。在TRACE上对18个护栏模型的评测显示,对推理轨迹的安全判断远难于对提示词或最终回复的判断,且现有模型难以准确提取支撑证据。这些发现凸显了开发能够可靠检测并精确定位LLM推理流程各环节不安全内容的护栏模型的必要性。

TRACE:面向大型推理模型安全评测的证据支撑基准:论文配图
图2:TRACE基准构建流程概览。➀ 从两个公开数据集中筛选安全与不安全提示。➁ 四个LRM为每个提示生成推理轨迹和最终响应。➂ 另外三个LRM对提示、推理轨迹和最终响应的安全性进行标注,并从相应源文本中提取支持证据。安全标签由多数投票确定。提取的证据仅在其由多数派标注者提供且被验证为源文本的连续子串时才保留。无可验证证据的样本进一步由人工标注者复核,得到最终标注结果。