论文
PRISM:从语言模型激活恢复指令集
PRISM: Recovering Instruction Sets from Language Model Activations
摘要
由于 LLM 被部署为代理,因此可靠的监控不仅需要了解它们输出的内容,还需要了解哪些指令正在引导它们的行为。当模型推断出非预期的子目标、遵循上下文线索或受到即时注入和隐藏目标的影响时,这就很困难。虽然激活语言方法表明隐藏状态可以揭示自然语言信息,但现有方法并非旨在恢复在代理设置中活跃的全套同步指令、约束、禁止和子目标。我们将这个问题形式化为指令集检索,并引入 PRISM,这是一种激活条件解释器,它将隐藏状态从冻结的目标模型解码为活动指令的忠实项目符号列表。与之前的激活语言方法不同,PRISM 经过训练可以直接恢复指令集,使用法官引导的 GRPO 来奖励覆盖的指令并惩罚不受支持的指令。在良性、受限、提示注入和隐藏目标设置中,PRISM 的性能优于激活语言基线,尤其是在安全相关目标上。
