论文
ForeSight:通过早期安全信号蒸馏加强风险监控
ForeSight: Enhancing Risk Monitoring via Early Safety Signal Distillation
摘要
随着大型语言模型 (LLM) 的部署越来越多,有害内容的生成已成为一个关键的安全问题。现有的安全措施在输入、输出或流生成阶段运行,而依赖表面词元或输出logits的早期风险方法可能会受到初始信号较弱的影响,而使用密集表示的基于内部的检测器可能会保留高度纠缠和冗余的与安全无关的信息。因此,目前尚不清楚最早的后代隐藏状态是否已经包含有关最终响应危害性的可靠信号。为了解决这一差距,我们提出了 ForeSight,这是一个首词元输出风险预测框架,可将微弱且冗余的早期安全信号提炼为紧凑的、分层感知的风险表示。对五个安全基准和两个目标模型的实验表明,ForeSight 在仅依赖第一个词元隐藏状态的情况下实现了卓越且高效的早期风险预测。代码位于:https://github.com/Scabbards1500/Foresight