论文
同一问题,不同答案:评估超越准确率的大语言模型可靠性
Same Question, Different Answers: Evaluating LLM Reliability Beyond Accuracy
摘要
大语言模型(LLM)在基准测试上往往能取得很高的准确率,但当同一问题以不同却等价的方式表述时,模型运用这些知识的可靠程度仍不清楚。本工作研究在保义改写下,模型在事实问答与数学推理任务上的答案如何变化。在四个基准和13个模型上,我们发现模型输出常常取决于提示词的确切措辞。虽然总体准确率在不同改写下通常只有小幅变化,但实例层面的行为远不稳定:对许多问题而言,模型会因措辞不同而在正确与错误答案之间摇摆,不匹配率超过23%。以原始形式答对的问题为条件进行分析,以答案翻转率衡量的失败更为严重,这表明单次提示下的正确性往往是可靠性的糟糕指标。与此同时,我们发现模型往往至少能对问题的某一改写版本给出正确答案,这表明底层知识是存在的,只是检索不一致。基于这一观察,我们证明一种简单的自我改写策略可以在推理时部分恢复这种潜在知识并提升性能。综合来看,这些发现表明标准准确率指标可能掩盖大量不稳定,而对等价输入间一致性的评估能更清晰地刻画LLM的可靠性。
