论文

超越内容安全:大语言模型推理漏洞的实时监控

Beyond Content Safety: Real-Time Monitoring for Reasoning Vulnerabilities in Large Language Models

模型推理推理验证与自校正

摘要

大语言模型 (LLM) 越来越依赖显式思想链 (CoT) 推理来解决复杂任务,但推理过程本身的安全性在很大程度上仍未得到解决。现有的大语言模型安全工作侧重于内容安全——检测有害的、有偏见的或事实上不正确的输出——并将推理链视为不透明的中间工件。我们将推理安全视为一个正交且同样重要的安全维度:要求模型的推理轨迹在逻辑上一致、计算高效且能够抵抗对抗性操纵。我们做出三项贡献。首先,我们正式定义推理安全,并引入不安全推理行为的九类分类法,涵盖输入解析错误、推理执行错误和流程管理错误。其次,我们进行了一项大规模的普遍性研究,从自然推理基准和四种对抗性攻击方法(推理劫持和拒绝服务)中注释了 4111 个推理链,确认所有九种错误类型在实践中都会发生,并且每次攻击都会产生机械上可解释的签名。第三,我们提出了一个推理安全监视器:一个基于 LLM 的外部组件,与目标模型并行运行,通过分类嵌入的提示实时检查每个推理步骤,并在检测到不安全行为时发送中断信号。对 450 链静态基准的评估表明,我们的监视器实现了高达 84.88% 的步进级定位精度和 85.37% 的错误类型分类精度,大幅优于幻觉检测器和过程奖励模型基线。这些结果表明,推理级监控不仅是必要的,而且实际上是可以实现的,并将推理安全性确立为大推理模型安全部署的基本问题。