论文

预测,而非反应:LLM 流媒体基于价值的安全预测

Predict, Don't React: Value-Based Safety Forecasting for LLM Streaming

AI 基础设施AI安全与内容治理基础设施

摘要

在许多实际的 LLM 部署中,单个护栏用于提示和响应调节。提示审核对完全观察到的文本进行操作,而流式响应审核则需要在部分生成上做出安全决策。现有的基于文本的流护栏通常将这种输出侧问题描述为边界检测,训练模型来识别响应已经变得不安全的最早前缀。在这项工作中,我们引入了 StreamGuard,这是一种与模型无关的统一流护栏,它将调节制定为预测问题:给定部分前缀,该模型可以预测未来可能延续的预期危害。我们使用蒙特卡洛轨迹采样来监督​​这一预测,这使得早期干预无需精确的 词元级 边界注释。在标准安全基准中,StreamGuard 在输入审核和流输出审核方面都表现出色。在 8B 规模上,相对于 Qwen3Guard-Stream-8B-strict,StreamGuard 将聚合输入调节 F1 从 86.7 提高到 88.2,将聚合流输出调节 F1 从 80.4 提高到 81.9。在 QWENGUARDTEST response_loc 流媒体基准测试中,StreamGuard 达到了 97.5 F1、95.1 召回率和 92.6% 的准时干预率,而 Qwen3Guard-Stream-8B-stric 的 F1 值为 95.9、召回率 92.1 和 89.9%,同时将遗漏率从 7.9% 降低到 4.9%。我们进一步表明,基于预测的监督在标记器和模型系列之间有效转移:通过转移目标,Gemma3-StreamGuard-1B 达到 81.3 响应调节 F1、98.2 流 F1 和 3.5% 的漏失率。这些结果表明,无需精确的边界标签即可获得强大的端到端流调节,并且预测未来风险是低延迟安全干预的有效监督策略。