论文

早点停止,少花钱:隐藏状态探针作为 LLM 输出流调节的实用方法

Stop Early, Spend Less: Hidden-State Probes as a Practical Recipe for Streaming Moderation of LLM Outputs

模型推理解码与生成控制

摘要

在面向用户的系统中部署 大语言模型 需要高效的输出安全过滤。现有方法通常依赖于生成后应用的单独调节模型,这会使推理成本加倍,并且仅在生成完成后才检测违规行为。我们观察到调节所需的信号已经存在于模型隐藏状态中。基于此,我们训练了直接在内部激活上运行的轻量级 词元级 探针,生成每个词元的安全分数,这些分数可以汇总用于离线评估和在线干预。探测器重用来自生成器的激活,不需要额外的前向传递,从而在解码循环内实现亚毫秒级的每个词元安全检查。应用于单个中间层的探针可以恢复强保护模型的大部分决策,充当针对延迟而非准确性进行优化的低成本替代方案。在流式传输设置中,它可以在不安全输出完全生成之前停止或修改它们,用连续的 词元级 监控取代序列结束调节。与事后和流保护模型相比,我们的方法以最小的延迟成本实现了低几个数量级的计算开销。我们还提供了实用的部署方案,包括层选择、聚合策略、探测频率和触发阈值。最后,我们表明探针线性分量对应于剩余空间中的方向,从而以可忽略的成本实现检测和激活转向。