论文

使用结构化表示预测自然语言查询的因果效应

Predicting Causal Effects from Natural Language Queries using Structured Representations

模型评测基准与评测资源

摘要

随机对照试验是医学和社会科学的基石,因为它们可以可靠地估计因果效应。然而,它们的实施成本高昂且耗时,激发了人们对根据现有实验证据预测因果效应的兴趣。 大语言模型 (LLM) 的最新进展在知识密集型任务上表现出了强大的性能,引发了这些模型是否可以用于预测因果效应大小的问题。为了研究这个问题,我们引入了 Query2Effect,这是一个新的大规模基准测试,由超过 72,000 个与实验描述一致的自然语言问题组成,旨在通过沿着隐含性、抽象性和模糊性维度改变查询特异性来模拟现实的信息搜索场景。然后,我们提出了一个两步框架,首先生成查询的合成结构化表示,然后使用监督编码器模型预测效果大小。实验表明,微调在提高预测性能方面发挥着至关重要的作用,与提示的开箱即用的 LLM 相比,绝对误差降低了 -27% 至 -71%,并且我们的两步框架有利于域外泛化,凸显了将语义解释与数值效果估计分开的好处。