论文
LatentGuard:用于LLM护栏的高效可检查潜在推理
LatentGuard: Efficient and Inspectable Latent Reasoning for LLM Safeguards
摘要
基于推理的保护模型提高了LLM的安全性,但每轮交互都需要显式地解释理由,这使得部署成本高昂。虽然潜空间推理方法减少了token生成,将推理移到连续状态中,但由于安全审查接口的缺乏,它们在安全性审查和部署方面仍处于探索阶段。在这篇论文中,我们提出了LatentGuard,这是一个高效的可检查的安全保护框架,它将连续的潜空间推理带入了保护模型中。LatentGuard使用渐进式课程来逐步压缩任务相关的文本理由到紧凑的潜空间状态,从而允许从连续表示直接预测安全决定。为了保持可检查性,一个独立的辅助解码器在需求时生成紧凑的审计证据,从而保持推理路径与标准推理路径分离。实验结果表明,LatentGuard-8B在GuardReasoner-8B的基础上,将平均加权F1从83.95提高到84.91,同时将关键路径推理成本从268.56个生成的文本理由token减少到1.60个潜空间推理token。其审计解码器达到了85.75的审计实用性分数,展示了一条高效且可检查的安全部署路径。
