论文
CausalT5K:诊断和通知拒绝,以实现怀疑主义、阿谀奉承、检测校正和梯级崩溃的可信因果推理
CausalT5K: Diagnosing and Informing Refusal for Trustworthy Causal Reasoning of Skepticism, Sycophancy, Detection-Correction, and Rung Collapse
摘要
LLM 在因果推理方面的失败,包括阿谀奉承、梯级崩溃和错误拒绝,都有详细记录,但补救进展缓慢,因为没有基准可以进行系统诊断。我们推出了 CausalT5K,这是一个跨 10 个领域的 5,000 多个案例的诊断基准,用于测试三个关键功能:(1)检测梯级崩溃,其中模型用关联证据回答干预查询; (2)在敌对压力下抵制阿谀奉承; (3) 生成明智拒绝,在证据不确定时指定缺失信息。与综合基准不同,CausalT5K 在现实叙述中嵌入因果陷阱,并将性能分解为实用性(敏感性)和安全性(特异性),揭示了聚合准确性不可见的故障模式。 CausalT5K 通过严格的人机协作流程开发,涉及 40 名领域专家、迭代交叉验证周期以及基于规则、LLM 和人工评分的复合验证,CausalT5K 将 Pearl 的因果关系阶梯作为研究基础设施。初步实验揭示了静态审计策略普遍失败的四象限控制格局,这一发现证明了 CausalT5K 对于推进可信推理系统的价值。存储库:https://github.com/genglongling/CausalT5kBench
