论文

信心应该被校准超过一圈深度

Confidence Should Be Calibrated More Than One Turn Deep

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型 (LLM) 越来越多地应用于金融、医疗保健和教育等高风险领域,在这些领域中,与用户进行可靠的多轮交互至关重要。然而,现有的置信度估计和校准工作(构建值得信赖的 LLM 系统的主要方法)主要侧重于单轮设置,而忽视了多轮对话的风险和潜力。在这项工作中,我们引入了多轮校准的任务,将校准从静态属性重新构建为可靠多轮对话的动态挑战中心,其中需要根据对话历史记录在每轮校准模型置信度。我们首先揭示了这种设置的风险:使用 T 圈预期校准误差 (ECE@T)(一种跟踪圈数校准动态的新指标),我们表明用户反馈(例如说服)可能会降低多圈校准的性能。为了解决这个问题,我们提出了 MTCal,它通过替代校准目标最小化 ECE@T,并进一步利用 ConfChat 中的校准置信度,这是一种解码策略,可以提高多轮交互中模型响应的真实性和一致性。大量实验表明,MT-Cal 在多轮校准中实现了出色且一致的性能,而 ConfChat 在多轮交互中保留甚至增强了模型性能。我们的结果将多圈校准标记为将 LLM 校准扩展到安全、可靠和实际使用的缺失环节之一。