论文
TRACE:面向大型推理模型安全评测的证据支撑基准
TRACE: An Evidence-Grounded Benchmark for Safety Evaluation of Large Reasoning Models
摘要
大型推理模型(LRM)会生成中间推理轨迹,即使其最终回复看起来安全,这些轨迹也可能包含不安全内容。护栏模型旨在检测并拦截不安全内容,但现有的不安全内容检测基准主要关注提示词和最终回复,推理轨迹在很大程度上未被检验。此外,这些基准通常只提供二元安全标签,缺乏支撑判断的证据标注。为弥补这些不足,我们提出TRACE,一个覆盖LLM完整推理流程(提示词、推理轨迹和最终回复)的证据支撑安全评测基准。TRACE包含两种语言、覆盖九个风险类别和十种攻击策略的提示词。对每个提示词,由四个LRM生成推理轨迹和最终回复,我们为每个组件标注安全性,并从相应源文本中提取支撑证据。在TRACE上对18个护栏模型的评测显示,对推理轨迹的安全判断远难于对提示词或最终回复的判断,且现有模型难以准确提取支撑证据。这些发现凸显了开发能够可靠检测并精确定位LLM推理流程各环节不安全内容的护栏模型的必要性。
