论文
基于潜在推理的稳健高效护栏
Robust and Efficient Guardrails with Latent Reasoning
摘要
随着大语言模型(Large Language Model,LLM)越来越多地部署到现实应用中,维护其安全性至关重要。现有安全护栏通常依赖单次分类,或最近兴起的蒸馏推理。基于推理的护栏显著优于仅分类的基线,但会带来可观的查询延迟与token开销,使其难以用于高吞吐部署。为应对这一挑战,我们提出COLAGUARD,一种护栏模型,它通过分阶段训练课程把多步安全推理迁移到连续潜在空间,从而在推理时实现隐藏状态的直接传播。在覆盖八个安全基准的十种提示与响应审核设置中评估,COLAGUARD的macro-F1比Llama Guard 3提升8.24分,并在macro-F1上与我们的显式推理基线GuardReasoner持平,同时实现12.9倍加速和22.4倍的token用量降低。我们的结果表明,对于可部署的护栏而言,潜在推理是显式生成推理理由的实用替代方案,能同时提升安全稳健性与推理效率,而不是把二者当作相互冲突的目标。
