论文
大语言模型 不确定性中的人类对准、校准和激活模式
Human-Alignment, Calibration, and Activation Patterns in Large Language Model Uncertainty
摘要
不确定性量化是 大语言模型 行为分析的一个庞大且不断发展的子领域。主要是为了识别和对抗幻觉,该领域主要集中在测量和改进校准、任务效能的不确定性判断的准确性。在这项工作中,我们研究了相对未充分探索的问题,即 大语言模型 不确定性与人类不确定性有多么相似。我们研究了 大语言模型 公开行为和内部激活模式中与人类相似的不确定性信号的存在和强度,这些信号被视为不确定性对齐。我们确定模型是否显示出在涵盖多项选择和开放式事实回忆的各种数据集上同时对齐和校准的证据。我们描述了指令 微调 对每个方面的影响。