论文

ACUTE 协议:操作语言模型激活以实现更好的校准、实用性和信任

The ACUTE Protocol: Operationalizing Language Model Activations for Better Calibration, Utility, and Trust

模型评测评测方法与指标

摘要

随着语言模型的改进并越来越多地部署来解决各种任务,可信性变得至关重要。校准是信任的良好代表:经过良好校准的置信度估计有助于在信任特定模型输出时告知风险与回报的权衡。不幸的是,即使模型有所改进,它们的校准仍然很差,往往会过度自信。此外,校准可以被玩弄:总是预测基本利率的策略是完美校准的,但完全没有信息。为了解决这个问题,我们开发了一种新的指标,即由预言机(欧元)重新标准化的预期效用,它可以平衡校准和信息性。我们还提出了一种通用的基于激活的置信度、效用和信任估计协议(ACUTE),以适当地裁决不确定性。 ACUTE 协议为 4 个模型系列的 6 个模型的多项选择题回答、工具调用和科学文档摘要等 3 项任务提供灵活、样本高效和计算高效的置信估计器。 ACUTE 的表现优于欧元的强大基线,同时保持较低的校准误差。总而言之,我们的工作表明,为 LLM 配备 ACUTE 协议可以提高多种设置中的校准、实用性和可信度。