论文

通过情境学习理论理解和改进 LLM 的持续对抗训练

Understanding and Improving Continuous Adversarial Training for LLMs via In-context Learning Theory

模型训练监督微调与指令调优

摘要

对抗训练(AT)是 大语言模型(LLM)抵御越狱攻击的有效防御方法,但在 LLM 上执行 AT 成本高昂。为了提高 LLM 的 AT 效率,最近的研究提出了连续 AT (CAT),它在 AT 期间在 LLM 的连续嵌入空间内搜索对抗性输入。虽然 CAT 取得了经验上的成功,但其基本机制,即为什么嵌入空间中的对抗性扰动可以帮助 LLM 防御输入词元空间中合成的越狱提示,仍然未知。本文首次基于情境学习(ICL)理论对 LLM 上的 CAT 进行理论分析。对于在上下文线性回归任务中使用来自嵌入空间的对抗性示例进行训练的线性 Transformer,我们证明了一个鲁棒的泛化界限,它与嵌入空间中的扰动半径呈负相关。这清楚地解释了为什么CAT可以抵御来自LLM词元空间的越狱提示。此外,鲁棒界限表明,经过对抗训练的 LLM 的鲁棒性与其嵌入矩阵的奇异值密切相关。基于此,我们建议通过在 CAT 的目标函数中引入一个额外的正则化项来改进 LLM CAT,该正则化项取决于 LLM 嵌入矩阵的奇异值。对现实世界 LLM 的实验表明,我们的方法可以帮助 LLM 实现更好的越狱鲁棒性与实用性权衡。该代码可从 https://github.com/fshp971/continuous-adv-icl 获取。