论文

通过测试时间判别性进行自校准语言模型 蒸馏

Self-Calibrating Language Models via Test-Time Discriminative Distillation

模型推理推理验证与自校正

摘要

大语言模型 (LLM) 系统性地过度自信:他们经常对自己经常回答错误的问题表现出高度确定性。现有的校准方法要么需要标记的验证数据,要么在分布变化下退化,要么产生大量的推理成本。最近的工作表明,LLM 已经包含了比他们口头表达的信号更好的校准信号:当模型被问到“这个答案正确吗?”时,“True”的标记概率。 ($P(\text{True})$) 始终优于他们所声明的置信度,这一差距在理论上是基于生成误差的下限约为相应判别误差的两倍。我们引入了 $\textbf{SECL}$ ($\textbf{SE}$lf-$\textbf{C}$alibrating $\textbf{L}$anguage Models),这是一个测试时训练 (TTT) 管道,它利用这一差距作为无标签自我监督,不需要标记数据或人工监督。 SECL 仅在输入分布发生变化时进行调整,仅对 6--26% 的问题流进行训练,其成本低于其提取的基线。在来自三个模型系列和四个不同领域的四个小语言模型中,SECL 将预期校准误差 (ECE) 降低了 56--78%,优于其自身的监督信号,并匹配或优于最近的推理时间方法。 SECL是第一个将TTT应用于校准的方法;涵盖信号质量、门控策略、权重累积、损失设计、域排序、超参数敏感性和层选择的七项消融证实,每个组件在不同配置中都是至关重要且稳健的。代码:https://anonymous.4open.science/r/secl-emnlp26-submission-C890