论文

小模型也可以合理地自我评估自己的信心

Also Small Models Can Reasonably Self-Evaluate Their Confidence

模型评测鲁棒性、公平性与可信度评测

摘要

这项研究系统地评估了不同规模的不同语言模型在跨越一般知识领域和专业知识领域的问答任务中基于自我评估的不确定性量化。使用模型判断自己的预测的各种自我评估方法,我们研究模型规模和领域特异性如何影响自我评估置信信号的质量。我们的结果表明,虽然随着较小的模型和更专业的领域的出现,准确率可预见地下降,但自我评估信心的可靠性在两个维度上基本保持稳定。这种独立性意味着最有能力的模型不一定是最擅长自我评估预测可靠性的模型。这些发现表明,尽管精度较低,但较小的模型仍可以实现合理的自我评估置信度,从而使其适用于资源受限的部署。