论文

超越信心:重新思考 LLM 中绩效预测的自我评估

Beyond Confidence: Rethinking Self-Assessments for Performance Prediction in LLMs

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型 (LLM) 越来越多地用于可靠的自我评估至关重要的环境中。评估模型可靠性已经从使用概率正确性估计发展到最近的引发口头信心。然而,信心已被证明是模型正确性的不一致且过于乐观的预测因素。借鉴人类心理学框架认知评价理论,将自我评价分解为多个组成部分,我们提出了模型自我评价的多维视角。我们引出了六个基于评估的自我评估维度以及信心,并评估了它们在 12 个 LLM 和跨越 8 个领域的 38 个任务中预测模型失败的效用。我们发现,在大多数情况下,与能力相关的评估维度,特别是努力和能力,始终匹配或优于信心。此外,努力还可以减少过度乐观的估计,并且在不同模型大小之间保持稳定。相比之下,情感维度提供的预测信号微乎其微。此外,信息量最大的维度随任务特征而系统地变化:努力对于推理密集型任务最具预测性,而能力和信心在面向检索的任务中占主导地位。总的来说,我们的研究结果表明,结构化多维自我评估是一种很有前途的方法,可以提高跨不同现实世界环境的语言模型部署的可靠性和安全性。