论文
挖掘大语言模型的非对抗鲁棒性
Harnessing non-adversarial robustness in large language models
摘要
本工作提出一种方法,以应对大语言模型(LLM)在面对语义相似但文本表述不同的提示所造成的改动与潜在错误时的鲁棒性挑战。近期研究已表明,这类提示变体会显著影响 LLM 的任务表现。核心问题是:能否无需代价高昂的整模重训练,就让 LLM 获得对语义中性提示改动的鲁棒性?我们从理论与实验两方面回答这一问题。我们的理论分析揭示了影响模型鲁棒性的一个关键因素——神经网络模块输出中的系统性期望偏移,即扰动诱发的偏差。受此分析启发,我们证明鲁棒性可以通过一个简单的微调过程获得:面向鲁棒性的去偏。我们界定了去偏在何种条件下有效、何种条件下无效,并通过理论与大量实验证明,面向鲁棒性的去偏确实可以成为增强鲁棒性、并针对随机提示扰动提供认证的快捷高效工具。
