论文
对提示词稳健的语言模型:哪些训练策略有效?
Prompt-Robust Language Models: Which Training Strategies Work?
摘要
尽管性能强大,大语言模型仍然对提示表述高度敏感。先前的工作通过精细的数据构建或专用的稳健性目标来解决这个问题。我们在受控条件下重现和比较这些策略,并衡量它们在解决模型即时敏感性方面的有效性。我们发现当前的鲁棒性微调方法比标准微调和上下文学习有所改进,但最好与最差的提示差距仍然高达性能的 40-57%。此外,我们最近测试的鲁棒性增强方法(用于对比对齐的 CoIN 和用于一致性正则化的 PPCL)通常无法胜过最简单的数据构建策略:每批次使用一个模板进行训练。我们的诊断解释了这些结果。辅助目标会改变它们惩罚的数量,但不会超出它。此外,由于 57-64% 的参数上每个模板梯度的符号相互冲突,数据构建策略也有所不同。因此,混合配方的批次迫使优化器协调竞争更新,而不是寻找共享的、与提示无关的更新。