论文

通过 词元级 温度缩放改进语言模型问答中的语义不确定性量化

Improving Semantic Uncertainty Quantification in Language Model Question-Answering via Token-Level Temperature Scaling

模型评测鲁棒性、公平性与可信度评测

摘要

校准是可靠的语义不确定性量化的核心,但之前的工作主要集中在区分上,忽略了校准。由于校准和歧视捕获了不确定性的不同方面,因此仅关注歧视会产生不完整的情况。我们通过一系列广泛的信心指标系统地评估这两个方面来解决这一差距。我们表明,当前的方法,特别是固定温度启发式方法,会产生系统性的错误校准和辨别力较差的语义置信度分布。我们证明,优化单个标量温度(我们认为它提供了合适的感应偏置)是一种令人惊讶的简单而有效的解决方案。我们详尽的评估证实,温度缩放持续改善语义校准、辨别力和下游熵,在问答任务上优于启发式基线和更具表现力的 词元级 重新校准方法。