论文
可执行因果研究管道的自动合成和对抗性验证
Automated Synthesis and Adversarial Validation of Executable Causal Research Pipelines
摘要
虽然自动化研究系统有望加速实证分析,但它们很容易出现无声故障:分析代码成功执行但依赖于无效因果假设的情况。我们提出了基于人工智能 (AI) 的流行病学研究助理 (ARA),这是一个框架,通过明确编码因果设计原则、特定于研究的假设和方法限制,使这些失败变得可见。 ARA 将协议构建、合成数据生成和对抗性验证集成到统一的管道中。该框架首先构建协议,然后使用具有已知 真值 效应的结构因果模型 (SCM) 生成合成数据集,从而将自然语言研究问题转化为结构化因果协议和可执行分析代码。当对机密数据(例如医疗数据)的访问受到限制时,此合成数据步骤还可以支持管道开发。然后在受控的违反识别假设的情况下评估生成的分析。我们根据自动因果推理基准评估 ARA,评估识别策略的恢复、因果数量、治疗和结果变量,以及生成的代码和批准的协议之间的一致性。与基于标准 LLM 的生成相比,协议构建和对抗性验证并没有始终如一地改善与基准估计的数值一致性。然而,他们改变了失败模式:ARA 不是默默地返回因果估计,而是经常出现协议问题、诊断失败、不完整的推理或降级的非因果解释。这些发现表明,有效性第一的自动化科学系统不仅应该通过答案的准确性来评估,还应该通过它们是否表明因果关系何时是没有根据的来评估。