论文
T3:因果判断中的谄媚与怀疑的标杆
T3: Benchmarking Sycophancy and Skepticism in Causal Judgment
摘要
我们引入 T3(测试可信思维),这是一个诊断基准,旨在严格评估 Pearl 因果关系阶梯上的 LLM 因果判断。 T3 由 454 个专家策划的小插图组成,优先考虑高分辨率故障分析,将性能分解为实用性(敏感性)、安全性(特异性)和对不确定情况的明智拒绝。通过将 T3 应用于前沿模型,我们诊断出两种不同的病态:L1 的“怀疑陷阱”(其中像 Claude Haiku 这样的安全调整模型拒绝 60% 的有效链接)和 L3 的非单调缩放悖论。在后者中,较大的 GPT-5.2 在模棱两可的反事实方面比 GPT-4-Turbo 低 55 个点,其驱动因素是陷入瘫痪(过度对冲)而不是幻觉。最后,我们使用基准测试来验证过程验证协议(RCA),表明T3成功地捕获了结构化验证下决定性因果判断的恢复。
