论文
LANTERN:对嘈杂和转换任务进行语言模型评估,以理解错误和鲁棒性的细微差别
LANTERN: Language Model Assessment on Noisy and Transformed Tasks for Understanding Error and Robustness Nuances
摘要
大语言模型 (LLM) 的稳健性评估仍然是一个严峻的挑战,特别是在评估其对输入数据扰动的敏感性方面。在这项工作中,我们系统地评估了 LLM 跨多个维度的鲁棒性,包括单词错误率、字符重复和重复、选择的修改以及指令遵循的可变性。为了促进这一评估,我们构建了一个综合和增强的数据集,其中包含一组不同的 LLM 基准,特别针对多项选择问题 (MCQ) 数据集和指令跟踪任务。我们对不同规模(小、中、大)的 LLM 以及跨基础和指令调整的变体进行了广泛的实验。我们的分析量化了扰动条件下模型响应的变异性,并强调了相对于基线模型的差异。研究结果深入了解了 LLM 在不同评估场景中的稳定性,有助于开发更强大、更可靠的语言模型以及稳健的评估方法。