论文
小语言模型中言语不确定性的可证明限制和认证延迟
Provable Limits and Certified Deferral for Verbalized Uncertainty in Small Language Models
摘要
小型开放权重语言模型越来越多地在私有、离线和成本敏感的环境中运行,其中关键的部署问题不仅是模型回答什么,而且何时应该遵循人类的要求。我们研究言语信心是否可以支持风险控制的延迟,在 ARC-Challenge 和 TruthfulQA 上评估来自三个系列的 11 个指令调整模型,参数为 0.5B 到 14B,并有 25,168 个本地预测。三个理论结果界定了校准可以提供的功能:严格单调校准保留了风险覆盖边界和错误检测 AUROC;温度缩放无法校准置信度保持在二分之一以上而精度低于二分之一的模型; Clopper-Pearson 程序将 200 个问题的校准集转换为独立同分布下的有限样本风险证书。部署假设。根据经验,22 个模型-任务对中有 8 个达到了温度缩放不可行性下限,与预测界限相差 1 个百分点以内。 Platt 缩放将 ECE 降低至 0.02,但在 20% 风险预算下,仅向三个模型任务对授予经过认证的自主权,而在 10% 风险预算下则没有授予任何一个。我们还以 TruthfulQA 的多项选择形式识别并修复答案排序工件。校准给出置信语义;经过认证的延迟决定了小型模型何时可以安全使用。