论文

正确性筛选多教师蒸馏中的决策转移、标签失效与依据审计

Decision Shifts, Lost Label Functionality, and an Inconclusive Grounding Audit in Correctness-Gated Multi-Teacher Distillation

模型评测模型行为与机制分析

摘要

候选人决策的正确性和理由基础是不同的目标。我们在固定实验中检查正确性门控多教师蒸馏。八个臂共享 4,330 个源、一个 6390 万个参数学生、12,990 个优化行、406 个更新、证据输入和解码器;七个教师组使用一个固定的三响应池。在 267 个保留的示例中评估了三个种子。相对于未过滤的蒸馏,正确性加权臂的准确度相差 +0.1660(95% 观察矩阵间隔 [0.0670, 0.2455]),五标签宏 F1 相差 +0.1323([0.0916, 0.1731]),任务定义的条件不安全操作率相差 -0.4979([-0.5926, -0.3686])。这些转变并不意味着一致更好的行为。源标签 SFT 具有最高的平均宏 F1 (0.586)。加权臂在每个种子中的反驳回忆为零,并且两个种子向所有 167 个声明示例分配了 NotEnoughInfo。在对一个参考种子进行的可用性修正审核中,加权和未过滤的输出有 0/20 与 1/20 有证据支持的阳性,20/20 与 19/20 包含无支持材料的阳性。样本不配对,源重叠未序列化,修改遵循自动汇总但先于注释。因此,审计无法估计共源证据依据效应,并且对于系统级改进或损害也没有结论。硬过滤已经实现了0.660的精度、0.530的宏F1和0.135的条件不安全率。所实施的加权臂并未显示出相对于硬过滤的增量决策优势。这种固定矩阵故障分析显示了标签功能丢失的决策重新分配;现有的人工审计并没有建立基础收益。