论文

干预式落地审计:经谓词替换的LLM思维链前提依赖黑盒测试

Interventional Grounding Audits: Black-Box Premise-Dependency Tests for LLM Chain-of-Thought via Predicate Substitution

模型评测评测方法与指标

摘要

大语言模型产出看似逻辑严密的思维链(CoT)推理,但可能并不真正依赖其陈述的前提。我们引入干预式落地审计:一个黑盒、步级的前提依赖测试——通过把目标谓词替换为新鲜符号对单个前提进行干预,重新运行模型,并检查每个推理步骤的规范化结论(规范谓词形式)是否改变。我们在ProntoQA——一个带金标证明树的合成多跳演绎推理基准(步级前提依赖已知)上评估。以GPT-4o应用于50个ProntoQA问题:该方法在检测证明树依赖上取得F1=0.806(谓词决定性依赖F1=0.885;召回100%),显著超过自洽性基线(F1=0.343;95%自助置信区间不重叠)。我们进一步发现:66%的正确解答问题包含至少一个在一致替换下对直接证明树依赖不敏感的对齐步骤——全部涉及实体引入前提,这是一致替换评估器已记录的盲点——一个被动方法不可见的“答案对、推理错”信号。全部审计证书、原始输出与复现脚本见公开GitHub仓库;我们讨论超越形式可解析基准的范围限制。