论文

CausalT5K:诊断和通知拒绝,以实现怀疑主义、阿谀奉承、检测校正和梯级崩溃的可信因果推理

CausalT5K: Diagnosing and Informing Refusal for Trustworthy Causal Reasoning of Skepticism, Sycophancy, Detection-Correction, and Rung Collapse

模型评测基准与评测资源

摘要

LLM 在因果推理方面的失败,包括阿谀奉承、梯级崩溃和错误拒绝,都有详细记录,但补救进展缓慢,因为没有基准可以进行系统诊断。我们推出了 CausalT5K,这是一个跨 10 个领域的 5,000 多个案例的诊断基准,用于测试三个关键功能:(1)检测梯级崩溃,其中模型用关联证据回答干预查询; (2)在敌对压力下抵制阿谀奉承; (3) 生成明智拒绝,在证据不确定时指定缺失信息。与综合基准不同,CausalT5K 在现实叙述中嵌入因果陷阱,并将性能分解为实用性(敏感性)和安全性(特异性),揭示了聚合准确性不可见的故障模式。 CausalT5K 通过严格的人机协作流程开发,涉及 40 名领域专家、迭代交叉验证周期以及基于规则、LLM 和人工评分的复合验证,CausalT5K 将 Pearl 的因果关系阶梯作为研究基础设施。初步实验揭示了静态审计策略普遍失败的四象限控制格局,这一发现证明了 CausalT5K 对于推进可信推理系统的价值。存储库:https://github.com/genglongling/CausalT5kBench

CausalT5k:跨因果层级诊断可信因果推理中的拒答与失败模式
图1:由CausalT5k的压力变体所实现的四象限控制图景。模型按Paranoia Rate(偏执率,y轴)与Sycophancy Ratio(谄媚比,x轴)分类。静态控制策略会失效:过弱的控制放任谄媚(Q4);过度的控制诱发偏执(Q3)。若没有配对的中性/压力案例,这种分类便无法实现。示意图展示四象限控制图景,坐标轴为Paranoia Rate与Sycophancy Ratio,各象限表示不同的控制结果。