论文

基于潜在推理的稳健高效护栏

Robust and Efficient Guardrails with Latent Reasoning

模型训练监督微调与指令调优

摘要

随着大语言模型(Large Language Model,LLM)越来越多地部署到现实应用中,维护其安全性至关重要。现有安全护栏通常依赖单次分类,或最近兴起的蒸馏推理。基于推理的护栏显著优于仅分类的基线,但会带来可观的查询延迟与token开销,使其难以用于高吞吐部署。为应对这一挑战,我们提出COLAGUARD,一种护栏模型,它通过分阶段训练课程把多步安全推理迁移到连续潜在空间,从而在推理时实现隐藏状态的直接传播。在覆盖八个安全基准的十种提示与响应审核设置中评估,COLAGUARD的macro-F1比Llama Guard 3提升8.24分,并在macro-F1上与我们的显式推理基线GuardReasoner持平,同时实现12.9倍加速和22.4倍的token用量降低。我们的结果表明,对于可部署的护栏而言,潜在推理是显式生成推理理由的实用替代方案,能同时提升安全稳健性与推理效率,而不是把二者当作相互冲突的目标。

基于潜在推理的稳健高效护栏:论文配图
图 1:CoLaGuard 概述。与在分配标签之前生成思想链标记的显式推理护栏(左)不同,CoLaGuard(右)通过循环潜在状态进行推理,保留了调节性能,同时避免了标记生成开销,并使推理速度提高了 12.9 倍,标记数量减少了 22.4 倍。 CoLaGuard 的分阶段内化课程(中心)从显式 CoT 监督开始,逐步用潜在状态取代推理标记,将推理转变为隐藏激活。