论文

Prompted to Discriminate:恶意输入探针的野外泛化

Prompted to Discriminate: Generalizing Malicious-Input Probes in the Wild

模型评测安全与风险评测

摘要

LLM智能体日益依赖激活探针作为提示注入、越狱与不安全请求的运行时监视器,读取模型自身隐状态以在智能体行动前捕获有害输入。一个廉价且日益常见的做法借自LLM-as-judge提示:在用户回合后追加简短分类指令并在该处读探针以锐化它——指令要求模型把输入表示为一个类,集中探针需分离的信号,服务成本可忽略。但后缀措辞是否重要?其收益在探针训练未见过的攻击类型(部署监视器面对的场景)下是否成立?我们在13个安全基准(越狱、注入与良性对话)与三个开源模型族(Llama-3.1-8B、Qwen3.5-9B、Gemma-4-12B)上,以受控的 post-user 后缀阶梯在严格留一数据集(LODO)评估下检验。单位置探针上,分类后缀一致改善OOD检测(至多约4 AUC点),且哪种后缀很重要:提示模型对输入分类(哪怕是内容无关标签)稳定取胜,离题或仅关注型后缀帮助甚微。增益来自分类格式而非所命名的标准:内容无关后缀与真实恶意/良性后缀相当,明确标准只在严格阈值下增加精度。这并非单位置读取的伪象:收益可迁移到生产使用的多位置池化探针(attention、multi-max、MLP),但最佳后缀依读出而异。经KV缓存fork服务,它是任何激活探针监视器的廉价即插即用件,但并非自动获胜:哪种后缀有效及幅度取决于模型与读出。