论文
Project Ariadne:审计 LLM Agent 忠实性的结构因果框架
Project Ariadne: A Structural Causal Framework for Auditing Faithfulness in LLM Agents
摘要
随着大型语言模型(LLM)Agent 越来越多地被委以高风险的自主决策,其推理过程的透明度已成为关键的安全关切。虽然思维链(CoT)提示使 Agent 能够生成人类可读的推理轨迹,但这些轨迹究竟是模型输出的忠实(faithful)生成驱动因素,还是仅仅事后(post-hoc)的合理化,仍不清楚。我们提出 Project Ariadne,一个利用结构因果模型(SCM)与反事实逻辑来审计 Agent 推理因果完整性的新型 XAI 框架。与依赖表层文本相似度的现有可解释性方法不同,Project Ariadne 对中间推理节点执行硬干预(do-演算)——系统地反转逻辑、否定前提并反转事实主张——以测量最终答案的因果敏感度(φ)。我们对最先进模型的实证评估揭示了一个持续存在的忠实性差距(Faithfulness Gap)。我们定义并检测到一种被称为因果解耦(Causal Decoupling)的普遍失败模式:Agent 在事实与科学领域中表现出高达 0.77 的违反密度(ρ)。在这些情形中,Agent 在内部逻辑相互矛盾的情况下得出相同结论,证明其推理轨迹充当的是“推理剧场”,而决策实际由潜在的参数先验支配。我们的发现表明,当前的 Agent 架构天生容易产生不忠实的解释;我们提出 Ariadne Score 作为让模型声明的逻辑与模型行动保持对齐的新基准。
