论文
评估基于 BERT 的模型在问答任务上的可靠性
Assessing Reliability of BERT-Based Models on Question Answering Tasks
摘要
在许多情况下,大语言模型 的可靠性估计与其准确性一样重要,因为可靠的模型更值得信赖、更稳健、更适合实际应用。自然语言处理 (NLP) 的最新进展,特别是基于 Transformer 架构的进展,显着加快了各种 NLP 任务的进展。本研究重点关注基于 Transformer 的问答 (QA) 模型的可靠性,特别是 BERT 模型及其变体(RoBERTa、ALBERT、DistilBERT)。这些仅编码器预训练的 Transformer 在可视为分类任务的 QA 任务中表现出了卓越的准确性。然而,它们的可靠性仍未得到充分探索。本研究通过评估两种条件下的响应稳定性来评估四种基于 BERT 的模型的可靠性:(1) 通过 Monte Carlo Dropout (MCD) 引起的内部模型变化和 (2) 通过释义引起的输入扰动。使用 SQuAD 和 QuAC 数据集,我们研究了丢失率如何影响预测一致性以及词汇变化是否影响答案稳定性。我们的研究结果表明 RoBERTa 保持了较高的可靠性,而 AlBERT 和 DistilBERT 表现出明显的不一致。统计分析证实,在预测期间启用 MCD 不会破坏推理动态,从而验证了其作为可靠性指标的有效性。这些发现强调了评估 QA 模型的准确性和稳定性以确保实际应用中的稳定性的重要性。