论文
越狱的前沿模型保留其功能
Jailbroken Frontier Models Retain Their Capabilities
摘要
随着语言模型保护措施变得更加强大,攻击者被迫开发越来越复杂的越狱。之前的工作发现,这种复杂性会产生“越狱税”,从而降低目标模型的任务性能。我们证明,这种税收与模型能力成反比,并且最先进的越狱实际上不会降低模型能力。对 Claude 模型的 5 个基准测试中的 28 次越狱进行评估,范围从 Haiku 4.5 到 Opus 4.6,我们发现 Haiku 4.5 越狱时基准性能平均下降 33.1%,而 Opus 4.6 在最大思考力下仅损失 7.7%。我们还观察到,在所有模型中,推理繁重的任务比知识回忆任务表现出更多的退化。最后,边界点越狱是目前针对已部署分类器的最强越狱,它实现了近乎完美的分类器规避,并且受保护模型的降级几乎为零。我们建议前沿模型的安全案例不应依赖于越狱造成的有意义的能力下降。