论文
小LLM的零样本置信度估计:什么时候监督基线不值得训练
Zero-Shot Confidence Estimation for Small LLMs: When Supervised Baselines Aren't Worth Training
摘要
小语言模型估计自身正确性的可靠程度如何?答案决定了「本地到云端的路由升级」——把廉价本地模型处理不了的查询升级——能否在没有监督训练数据的情况下工作。由于推理成本主导LLM部署预算,把大多数查询路由到便宜的本地模型、仅为困难用例保留昂贵的云端调用,是日益普遍的成本控制策略。我们在三个7-8B模型家族与两个数据集(每模型分别1,000与500条查询)上比较零样本置信度信号与RouteLLM式监督基线。平均token对数概率无需训练数据,分布内匹配或超过监督基线(AUROC 0.650-0.714 对 0.644-0.676),分布外大幅超越(0.717-0.833 对 0.512-0.564),因为它度量的是模型生成过程的性质而非查询分布。本文进一步提出检索条件自评估:一种生成前信号,在相似度高时选择性注入检索知识,较裸自评估最高提升+0.069 AUROC,时延比对数概率低3-10倍。用1,000条标注样本训练的监督基线始终未超过零样本信号。我们发布全部代码、数据与实验日志。