论文

使用研究人员指定的协变量生成基于 LLM 的文本分析的条件假设

Conditional Hypothesis Generation for LLM-Based Text Analysis with Researcher-Specified Covariates

应用与实践科学研究

摘要

计算社会科学的核心目标是发现语言在不同兴趣结果(例如政治立场或教学质量)之间变化的可解释差异。最近基于 LLM 的假设生成方法描述了自然语言中的此类差异,但选择了全局判别模式,而不考虑基于研究人员的领域知识塑造数据的协变量。当忽略协变量时,选定的模式可以反映混淆而不是实质性利益的差异。我们引入了条件假设生成,这是一个框架,其中包含研究人员指定的协变量,以引导假设发现针对相关子组内存在的差异。出现两个挑战:目标子组的代表性可能不足(层不平衡),并且子组之间差异的方向可能会逆转(符号反转)。我们提出了两种受计量经济学启发的方法:一种引入特征-协变量相互作用来检测符号反转,另一种应用层内贬低和逆频率重新加权来均衡代表性不足的层。综合实验表明,每种方法在其目标设置中都优于全局基线,并且对两个现实世界数据集的专家评估证实,协变量感知生成在相关子组中提出了更有用的假设。