论文

考试时的训练破坏了安全护栏

Test-Time Training Undermines Safety Guardrails

模型评测安全与风险评测

摘要

测试时训练 (TTT) 是一种新兴范例,使模型能够在推理过程中调整其参数,从而提高小样本学习、检索增强生成和复杂推理等任务的性能。然而,这种动态适应引入了新的漏洞,对手可以利用这些漏洞来越狱模型。我们确定了 TTT 的三种威胁模型,并演示了攻击者如何利用它们绕过安全过滤器。我们的结果表明,TTT 可以显着提高攻击成功率 (ASR) 和超过 10 代试验的 ASR (ASR@10)。例如,在 LoRA 下,小样本和生成阶段威胁模型在不同系列和规模的模型中分别实现了 95% 和 93% 的平均 ASR@10。这些漏洞转移到生产 微调 API。我们还表明,TTT 引起的过度拟合会产生退化输出,从而导致标准法官下的 ASR 膨胀,并提出了一种有效性感知评估来纠正这一问题。我们的研究结果表明,TTT 暴露了新的攻击面,强化了攻击,并破坏了现有的安全护栏。作为防御的第一步,我们提出了一个轻量级的提供商端检测器,通过私人有害抵抗的困惑度转变来标记 TTT 请求,但强大的部署最终需要动态对齐。