论文
SentGuard:大语言模型 的句子级流媒体护栏
SentGuard: Sentence-Level Streaming Guardrails for Large Language Models
摘要
大语言模型 越来越多地实时传输长的、推理密集型的响应,使得何时进行调节与是否进行调节一样重要。现有的护栏陷入两个令人不满意的极端:响应级方法延迟干预,直到生成完整的输出,而 词元级 方法作用于不完整的语义,通常会产生不稳定的决策和过多的保护调用。为了应对这一挑战,我们提出了 SentGuard,这是一种与生成并行运行的句子级流式护栏。轻量级等待缓冲区将流式词元分组为句子块,并仅向用户释放经过验证的块,从而引入一个小偏移量,使 SentGuard 能够在目标 LLM 解码后续内容时评估当前前缀。为了支持这一点,我们构建了 StreamSafe,这是一个基准,具有跨 8 个危害类别的结构化每句注释,捕获推理和响应部分的安全风险的演变。我们以从粗到细的目标进一步训练 SentGuard,以便在不安全意图出现在句子边界时立即检测到。对 5 个安全基准的实验表明,SentGuard 的性能优于现有基准,在两句话内检测出 90.5% 的不安全案例,同时保持 7.41% 的低流误报率。