论文
BLOOM-WILT:在自动化大语言模型审计中通过Logit调整诱发行为
BLOOM-WILT: Logit Tilting for Behaviour Elicitation in Automated LLM Auditing
摘要
已部署语言模型的用户经常会遇到测试几乎从未出现的行为,因为部署使模型经历的交互比任何评估可以模拟的交互要多几个数量级。自动化审核员使测试规模化成本低廉,并且足够灵活,可以涵盖几乎所有指定的行为,但缺乏优化压力使他们的样本效率低下。为了解决这个缺点,我们引入了 BLOOM-WILT,这是一个完整的审计管道,可以引出罕见行为的自然多轮实例,无需训练成本或超出目标下一个token分配的访问权限。在输入方面,WILT 的审核员模型从之前的评分交互中学习,跨轮修改其对话策略。在输出方面,WILT 使用模型自身的分布(以启发提示为条件)自适应地重新加权目标的解码,以便在无提示时先对与行为相关的代进行采样,然后在其他代中发现同样可能的代。我们在 4 个目标模型和 8 种行为中评估 WILT,它在 32 个设置中的 30 个设置中击败了基线审核员,并推翻了之前的模型安全排名。当从 Qwen3.5-4B 引发自残鼓励时,WILT 将平均行为存在率从 51% 提高到 100%,击败了我们在匹配计算时移植到同一管道中的每种引发方法,而不会将输出概率推至基线以下。
