论文
LLM 能否使用语言不确定性标记来可靠地反映内在信心?
Can LLMs Use Linguistic Uncertainty Markers to Reliably Reflect Intrinsic Confidence?
摘要
LLM用语言表达的自信应该忠实地反映其内在的不确定性。虽然最近的研究表明 LLM 很难以与人类一致的方式使用认知标记(例如,“很可能......”),但仍不清楚模型是否可以应用自己的语言置信框架以稳定且可概括的方式将标记与特定置信水平相关联,以及上下文特征如何影响这种能力。我们对这个问题进行了首次系统研究,将_标记内部置信度_(MIC)形式化为模型与给定任务域中的特定认知标记相关联的估计内在置信度。我们提出了 7 个指标来评估发行版内部和发行版之间 MIC 的稳定性。将我们的分析框架应用于不同的模型和任务,我们发现即使在以模型为中心的标记含义解释下,LLM 仍然忠实地错误校准,尽管在任务之间保持了某种程度一致的排名顺序,但仍难以通过分布之间的内部置信度来区分标记。这为现有工作提供了关键的补充证据,以全面了解 LLM 中的忠实校准,强调需要使用更加一致和稳定的标记来提高可信度和可靠性。