论文
模糊 大语言模型 以引发隐藏行为
Fuzzing Large Language Models to Elicit Hidden Behaviours
摘要
潜伏智能体是欺骗的典型模型有机体:经过训练的模型可以表现正常,但在特定触发条件下会发出不安全的行为。在不知道触发因素的情况下引发这种行为尚未得到系统研究。我们研究模糊测试:将高斯噪声注入模型的权重或残差流激活中,并检查扰动的输出是否揭示了行为。在 6 个后门模型 (7B-13B) 上,我们将两种形式的模糊测试与温度采样基线进行了面对面的比较。在 6 个模型中的 4 个模型上,模糊测试比温度采样更频繁地引发隐藏行为(在 OpenHermes-13B 上高达约 6 倍),哪种形式获胜取决于任务,因此两者都值得运行。每种方法的超参数网格中的启发是不均匀的:在大多数模型上,均匀扫描只能给出几个百分点,而最佳单元要高 2-10 倍,因此瓶颈是超参数选择,而不是技术。为了选择没有 真值 访问权限的超参数,我们使用一个廉价的代理任务(上下文秘密启发,其中将 Base64 编码的秘密放置在系统提示中以隐藏模型)并对其运行 Thompson 采样以选择候选单元格,我们在真实的后门上对其进行评估。在可以解码秘密的四个模型上,代理选择的单元使激活模糊引出比均匀扫描平均值提高约 4 倍(在最佳性能模型上恢复约 70% 的最佳单元率),并将权重模糊提高 1.3-1.8 倍。据我们所知,这是第一个对休眠代理后门进行模糊测试的系统研究,也是第一个展示代理任务超参数选择转移到实际任务启发的研究。我们还建议将此类结果报告为(统一基线、代理选择、预言机)三元组,因为这是先前工作经常模糊的三个不同的主张。