论文

LatentGuard:用于LLM护栏的高效可检查潜在推理

LatentGuard: Efficient and Inspectable Latent Reasoning for LLM Safeguards

模型训练监督微调与指令调优

摘要

基于推理的保护模型提高了LLM的安全性,但每轮交互都需要显式地解释理由,这使得部署成本高昂。虽然潜空间推理方法减少了token生成,将推理移到连续状态中,但由于安全审查接口的缺乏,它们在安全性审查和部署方面仍处于探索阶段。在这篇论文中,我们提出了LatentGuard,这是一个高效的可检查的安全保护框架,它将连续的潜空间推理带入了保护模型中。LatentGuard使用渐进式课程来逐步压缩任务相关的文本理由到紧凑的潜空间状态,从而允许从连续表示直接预测安全决定。为了保持可检查性,一个独立的辅助解码器在需求时生成紧凑的审计证据,从而保持推理路径与标准推理路径分离。实验结果表明,LatentGuard-8B在GuardReasoner-8B的基础上,将平均加权F1从83.95提高到84.91,同时将关键路径推理成本从268.56个生成的文本理由token减少到1.60个潜空间推理token。其审计解码器达到了85.75的审计实用性分数,展示了一条高效且可检查的安全部署路径。

LatentGuard:用于LLM护栏的高效可检查潜在推理:论文配图
图 1:现有的基于分类的防护很有效,但提供的决策透明度有限,而基于推理的防护通过明确的原理提高了可检查性,但代价是额外的延迟。 LatentGuard将安全预测与基本原理生成解耦:在标准推理过程中,它执行连续的潜在推理并直接预测安全标签;当请求检查时,隔离的辅助解码器将潜在状态转换为紧凑的审计工件。