论文

HarmThoughts:推理痕迹中细粒度有害行为检测的基准

HarmThoughts: A Benchmark for Fine-Grained Harmful Behavior Detection in Reasoning Traces

模型评测安全与风险评测

摘要

大型推理模型(LRM)会产生复杂的多步骤推理轨迹,但安全评估仍然侧重于最终输出,而忽略了推理过程中如何出现危害。越狱后,伤害不会立即出现,而是通过不同的行为步骤显现出来,例如压制拒绝、合理化合规性、分解有害任务和隐藏风险。然而,现有的基准还没有在推理轨迹中以句子级粒度捕获这一过程——这是实现可靠安全监控、干预和系统故障诊断的关键一步。为了解决这一差距,我们引入了 HarmThoughts,这是推理轨迹逐步安全评估的基准。 HarmThoughts 围绕我们提出的伤害分类法构建,包括 16 个功能推理行为类别,捕获推理步骤如何促成或减轻有害结果。该数据集由四个模型系列生成的 1,018 个推理轨迹中的 56,931 个句子组成,每个句子都用细粒度的句子级行为标签进行注释。使用 HarmThoughts,我们通过将分类行为组合成安全故障模式来分析危害传播,这些模式描述了推理如何转变为有害执行。我们比较白盒和黑盒监视器以识别细粒度的分类行为,并进一步评估受监督的 微调。虽然现成的监控器随着行为粒度的增加而急剧退化,但 微调 显着提高了性能,突出了细粒度过程级安全监控的难度和可学习性。