论文
无与伦比并不意味着错误:不完整的参考集可以逆转开放式心理理论跟踪中的校准排名
Unmatched Does Not Mean False: Incomplete Reference Sets Can Reverse Calibration Rankings in Open-Ended Theory-of-Mind Tracking
摘要
开放式思维理论 (ToM) 跟踪器发出有限参考中不存在的有效信念。有限参考加匹配器管道将不匹配的输出标记为假,创建代理标签,可以反转固定输出上的正确分数模型选择。保持 259 个信念和配对分数固定,参考记录将加权流行率从 0.783 降低到 0.295,并逆转了严格适当的 Brier 风险:在所有六个编写的场景中,冻结的源先验规则在参考标签下导致本机置信度提高 0.227,在盲法裁决下导致本机置信度提高 0.152。仅供参考的 Platt 再校准器进一步反转。 ICE 特有的逆转出现在已发布的 301 个问题 NQ-open DPR-BERT 管道中:其平均置信基线在精确匹配下将实例级校准误差改善了 0.045,但在人类正确性下将其恶化了 0.074,两个区间都不包括零。在独立撰写的 OpenToM 叙述中,90-96% 经审计的不匹配信念实际上是正确的,并且配对方向再次逆转。精确的分解将扭曲归因于遗漏的事实,并且封闭式标准正确地对十二个已发布系统的比较进行了分类。冻结审核回顾性重播显示 50 次尝试注释以至少 0.996 的概率恢复排名方向。 TriSource-Restore 将全帧参考标签和冻结的自动判断锚定到概率采样的人类飞行员,保持至少名义覆盖范围,缩小间隔,并根据基本速率部署门修复置信度。