论文

将自我一致性提炼为口头自信:Gemma 3 4B 上预先登记的负面结果和事后救援

Distilling Self-Consistency into Verbal Confidence: A Pre-Registered Negative Result and Post-Hoc Rescue on Gemma 3 4B

模型训练监督微调与指令调优

摘要

小指令调整的 LLM 在最小诱导下产生退化的言语信心:上限率高于 95%、接近机会的 2 型 AUROC 和无效的有效性配置文件。我们测试具有自洽导出目标的置信条件监督 微调 (CSFT) 是否可以缩小内部信息和口头读出之间的差距。 Gemma 3 4B-it 上预先注册的 Phase 0 协议带有模态过滤器,将训练限制为具有正确模态答案的项目,但产生了负面结果:由于训练目标中的标签熵崩溃,AUROC2 从 0.554 下降到 0.509。探索性救援移除了过滤器,对所有 2,000 个校准项目进行了训练。这在保留的 TriviaQA 上产生了 AUROC2 = 0.774 的二元语言正确性鉴别器,将 10 个样本的自一致性信号 (AUROC2 = 0.999) 压缩为超过 logits 熵 (0.701) 的单通道读数。洗牌目标控制没有显示出任何改进(0.501)。在 MMLU 上,基线上的改组模型的准确度从 54.2% 提高到 77.4% (56.1%),支持依赖于目标的解释。结果是探索性的、二元的,而不是连续校准的,并且是在单一尺度上观察的。它确定了两个设计教训:置信度训练需要标签熵,正确的目标规范输出格式。