论文

CasualSynth:生成结构合理的合成数据

CasualSynth: Generating Structurally Sound Synthetic Data

模型训练合成数据

摘要

大语言模型 (LLM) 生成真实的合成数据,但不能保证其输出遵循管理目标域的因果机制。我们引入了 CausalSynth,一个将因果结构生成与语义实现分离的框架,生成因果有效且语言丰富的合成数据。该框架分三个阶段运行。首先,结构因果模型(SCM)——在有向无环图(DAG)上定义的结构方程元组生成因果骨架,即通过祖先采样满足控制 DAG 的全局马尔可夫特性的变量分配。其次,LLM 充当受约束的 \emph{realizer},即一个将每个骨架映射到高维观察(例如临床记录或事务日志)的条件翻译器。第三,迭代一致性验证模块通过确定性提取检测结构违规,并将有针对性的修正反馈给LLM,形成闭环细化过程。我们确定了语义后门问题,即 LLM 用 预训练 先验覆盖强加的因果事实的系统趋势,并证明我们的迭代机制相对于标准拒绝采样减少了由此产生的选择偏差。在三个因果基准(ASIA、ALARM 和 MIMIC-Struct)上,CausalSynth 保留了条件独立性,假阳性率接近名义 $α=0.05$ 水平,并通过 70B 参数 LLM 主干实现了 96% 以上的可实现率。该框架还通过噪声保留和图形破坏支持有原则的干预和反事实生成。