Laya 作为类型化概率评估器:校准和选择性升级的独立再现和预注册研究
Laya as a Typed Probabilistic Assessor: An Independent Reproduction and a Preregistered Study of Calibration and Selective Escalation
摘要
已发布的 Laya Typed-Decisions 检查点是一个 421M 参数的 ModernBERT 大型评估器,用于回答有关工作流程状态的类型化选择/noul/分数问题,但始终缺乏信心。签名的置信度-准确度差距为 $-0.214$,每个占用的可靠性箱的准确性超过其置信度,并且该符号均匀性将每个分箱的 ECE 变体折叠为相同的值,即 $0.214$。该卡片将风险描述为过度自信;测量的方向是相反的,该方向决定置信门级联失败的方式。单个不相交的拟合温度($T=0.469$,锐化)消除了大部分错误校准(保留的 ECE $0.204$ 至 $0.037$),并且优于随附的每个选项计数表。相反,冻结选择规则选择了等渗回归,这在两个轨道上都过度拟合并导致其保留的 NLL 对比度失败,因此假设 H2 不受支持。在其完整的官方测试拆分中重新运行已发布的检查点可重现该卡的标题准确性(0.767 美元 vs 0.766 美元)。回顾性 E1 再现发生在分析冻结之前; E2-E8 是前瞻性预注册的,根据 Benjamini-Hochberg FDR 执行的 22 项验证测试中的 20 项以 $q=0.05$ 被拒绝(其中两项已取消范围)。冻结门击败了随机升级,但在两条轨道上都未达到 10% 接受设定的错误目标,探索性的分布外调查发现不存在零样本转移(准确度为 0.617 美元),并且每个分数都衡量与专家超出其自我同意上限(0.735 美元)的合成教师的一致性。每个决策的预测、运行清单和冻结的预注册都在辅助文件中。作者与模型发布者、数据集发布者或 TypeSafe 没有任何隶属关系。