论文

通过回归分析识别置信度校准中有影响力的 N 元模型

Identifying Influential N-grams in Confidence Calibration via Regression Analysis

模型评测模型行为与机制分析

摘要

虽然 大语言模型 (LLM) 通过显式推理提高性能,但他们的回答往往过于自信,即使其中包含表明不确定性的语言表达。在这项工作中,我们通过应用回归方法来确定哪些语言表达与置信度相关。具体来说,我们预测 LLM 推理部分中这些语言表达的置信度作为因变量,并分析特定 $n$-gram 与置信度之间的关系。在多个模型和 QA 基准测试中,我们表明 LLM 在涉及推理时仍然过度自信,并将这种行为归因于特定的语言信息。有趣的是,一些提取的表达式与在测试时间缩放中有意插入的提示短语相一致,以提高推理性能。通过我们对因果关系的测试并验证提取的语言信息确实会影响置信度,我们发现通过简单地抑制那些过度自信的表达而不会降低性能,可以进行置信度校准。