论文
Speculative Probing:以推测解码的成本监控大语言模型
Speculative Probing: LLM Monitoring at Speculative-Decoding Cost
摘要
语言模型推理过程中的实时分类对于安全过滤、行为分析和模型监控很有价值,但当前的方法迫使准确性和效率之间进行权衡。隐藏状态探针速度快但有限:它们要么不具有上下文感知能力:在单个向量上操作并且无法对跨位置的交互进行建模;或者它们的成本非常高:拥有专用的分类器模型(Llama Guard、Qwen Guard、LLM-as-judge)或对所有标记的隐藏状态进行计算,然后汇集结果(MultiMax)。这显示了效率和准确性之间的内在权衡。然而,我们发现最近LLM中的推测解码模块可以重新用于高效的高质量分类。通过在目标序列末尾附加经过训练的软提示,我们可以将推测解码模块重新调整为序列分类器。在推测解码管道中的推理时,KV 缓存已经在 GPU 内存中,因此分类增加的开销可以忽略不计。我们评估了四个模型(Qwen3.5-4B、9B、27B、MiniCPM4.1-8B)的四个分类任务。我们的小型探针始终优于零样本 GPT-5.4-mini,并且在多语言提示安全性方面,可以匹配或击败专门的 8B 安全分类器(Qwen3Guard-Gen-8B、Llama-Guard-3-8B),而无需运行完整的 LLM。