论文

T3:因果判断中的谄媚与怀疑的标杆

T3: Benchmarking Sycophancy and Skepticism in Causal Judgment

模型推理推理验证与自校正

摘要

我们引入 T3(测试可信思维),这是一个诊断基准,旨在严格评估 Pearl 因果关系阶梯上的 LLM 因果判断。 T3 由 454 个专家策划的小插图组成,优先考虑高分辨率故障分析,将性能分解为实用性(敏感性)、安全性(特异性)和对不确定情况的明智拒绝。通过将 T3 应用于前沿模型,我们诊断出两种不同的病态:L1 的“怀疑陷阱”(其中像 Claude Haiku 这样的安全调整模型拒绝 60% 的有效链接)和 L3 的非单调缩放悖论。在后者中,较大的 GPT-5.2 在模棱两可的反事实方面比 GPT-4-Turbo 低 55 个点,其驱动因素是陷入瘫痪(过度对冲)而不是幻觉。最后,我们使用基准测试来验证过程验证协议(RCA),表明T3成功地捕获了结构化验证下决定性因果判断的恢复。

诊断与缓解LLM因果判断中的谄媚与怀疑
图2:L2 能力与易感性(为什么 Utility/Safety 很重要)。(左)中性表现反映基线的干预判断能力。(右)易感性(Susceptibility)度量在不应翻转金标签的干扰压力下的标签漂移。在 T 3 -L2 上,大多数模型的社会压力接近于零,而认知压力(epistemic pressure)可能触发大幅反转,揭示出仅凭中性准确率无法捕捉的不稳定性。