论文

PRISM:从语言模型激活恢复指令集

PRISM: Recovering Instruction Sets from Language Model Activations

模型评测模型行为与机制分析

摘要

由于 LLM 被部署为代理,因此可靠的监控不仅需要了解它们输出的内容,还需要了解哪些指令正在引导它们的行为。当模型推断出非预期的子目标、遵循上下文线索或受到即时注入和隐藏目标的影响时,这就很困难。虽然激活语言方法表明隐藏状态可以揭示自然语言信息,但现有方法并非旨在恢复在代理设置中活跃的全套同步指令、约束、禁止和子目标。我们将这个问题形式化为指令集检索,并引入 PRISM,这是一种激活条件解释器,它将隐藏状态从冻结的目标模型解码为活动指令的忠实项目符号列表。与之前的激活语言方法不同,PRISM 经过训练可以直接恢复指令集,使用法官引导的 GRPO 来奖励覆盖的指令并惩罚不受支持的指令。在良性、受限、提示注入和隐藏目标设置中,PRISM 的性能优于激活语言基线,尤其是在安全相关目标上。

PRISM:从语言模型激活恢复指令集:论文配图
图 1:激活条件指令集检索。冻结的目标模型 ℳ\mathcal{M} 生成响应,我们从层 ℓ\ell 中提取 TT 残差流隐藏状态的窗口,形成激活快照 HℓH_{\ell}。学习的投影将这些状态映射到模型的嵌入空间,并由解释器 phi\phi (PRISM) 作为软前缀使用。解释器通过 LoRA 适配器重用 ℳ\mathcal{M} 的基本权重,并解码恢复指令的项目符号列表 ℐ^\hat{\mathcal{I}}。在 RL 培训期间,大语言模型法官会根据参考说明和幻觉子弹的覆盖范围对候选人名单进行评分。