论文

CERTID:推理模型在可识别性上准确但不可靠

Reasoning Models Are Accurate but Unsound on Identification

模型评测评测方法与指标

摘要

被问及某因果效应能否从观测数据恢复的推理模型可能以两种方式失败:拒绝一个可识别的查询,或回答一个不可识别的查询。后者后果更重——没有观测数据能验证所声称的公式。度量这种失败需要可证不可识别的查询(先前评估缺乏)与接受任何等价形式正确公式的评分(字符串匹配无法提供)。我们构建CERTID——解决两限的形式化识别管道:CERTID用可靠且完备的因果识别算法ID认证效应能否从给定图与查询识别,并针对干预分布精确已知的结构因果模型核验返回公式;CERTID还发展理论结果以缓解结构泄漏、修复不可识别查询并建立评分保证。我们在1200个认证实例(4至50顶点)上评估三个前沿推理模型(Gemini Flash、Gemini Pro与GPT5.5):准确率被证明是可靠性的糟糕代理——相同实例上不可识别查询的假主张率跨模型差17倍。我们还发现:在最强模型训练快照之后生成的图上,模型以97-100%准确率判定可识别性。实例、认证程序、验证器与逐实例记录公开可得。代码/项目页:https://anonymous.4open.science/r/certid-D718。