论文
自然语言理解任务的混合对抗防御
Hybrid Adversarial Defence for Natural Language Understanding Tasks
摘要
大语言模型 (LLM) 很容易受到幻觉和对抗性操纵的影响。尽管这些问题密切相关,但现有的防御措施通常单独解决它们。我们研究了一种混合防御框架,该框架将旨在减少幻觉的基于熵的模型与旨在减少脆弱性的基于不确定性的模型和基于几何的模型相结合。在自然语言理解数据集(FEVER、HotpotQA、CSQA、SIQA)的域内测试中,我们发现我们的混合模型提高了清理任务性能(准确率提高了 43.34%)和对抗鲁棒性(准确率提高了 64.92%,攻击成功率降低了 62.27%)。对于分布外数据集(AeroEngQA、CPIQA),我们从混合模型中看到了类似的对抗鲁棒性(准确率提高了 57.14%)。对于提示注入 (SafeGuard) 和越狱检测 (AdvBench、DAN) 数据集,我们的混合模型也非常强大(与最先进的基线模型相比,攻击成功率降低高达 51%)。总的来说,我们的结果表明,对于域内和分布外任务,结合熵、不确定性和几何特征提供了比单独使用任何单个特征更有效的防御策略。