论文

超越准确率与校准:Jev的关联问题概率是否自洽

Beyond Calibration: Do a Typed-Decision Model's Probabilities Obey the Probability Axioms?

模型评测模型推理判别式推理与决策模型能力评测Jev

摘要

类型化决策模型(例如 TypeSafe 的 Jev)用概率而不是文本来回答关于状态的声明的是/否或多选问题,并且它们的评估报告准确性和校准。两者都不要求模型给出的逻辑相关问题的概率逐项匹配在一起,而这正是作用于这些概率的系统所需要的。我们通过一系列逻辑上相互关联、不需要标签的问题来测试这种属性,即连贯性。对于来自 ChaosNLI 和 PubMedQA 的 160 个项目,每个项目都有三个互斥的标签,我们询问标签是否是 X、是否不是 X、是否是其他两个标签之一以及适用哪个标签。在 480 个否定对上,Jev 的“标签是 X”和“标签不是 X”的概率总和为 1,平均误差为 0.064(95% CI 0.055 至 0.072)。 Qwen3.8-27B,从其官方 BF16 权重运行,第一个标记概率的误差为 0.293,语言概率的误差为 0.122。在对两个系统给出相似概率、没有双重否定标签且对 Jev 的重复调用进行平均之后,第一个标记读出的差距仍然存在。 Jev 也不一致:它的违规行为大约是其重复噪声的五倍,并且它过度认可有关单个标签的陈述,因此它的三个单标签概率之和平均为 1.14。这两个系统的故障也不同。 Qwen3.8-27B 的第一个标记读数会低估标签的补语,无论问题是否包含“不”,拒绝 480 对中的 196 对中的陈述及其否定,并且在更有信心的地方并没有变得更加连贯,而 Jev 的违规行为集中在答案不确定的地方。由于检查不需要标签,因此它们会暴露仅在比较问题形式时出现的偏差以及项目内的不一致之处。

肯定与否定问题的概率互补性。
肯定与否定问题的概率互补性。