论文
通过跨人群的比较问题从 LLM 中得出临床变量之间的关联
Eliciting associations between clinical variables from LLMs via comparison questions across populations
摘要
大语言模型 (LLM) 的训练数据包含广泛的生物医学文献,反映了来自许多不同患者群体的数据。我们研究如何恢复患者特征之间的相关性和因果关系的信息,作为医疗决策的关键组成部分。为了避免直接启发的陷阱,我们提出了一种基于结构化比较问题的方法,特别是患者比较三元组问题。它与 LLM 表示的统计模型相结合,提供相关性估计,而无需访问激活或模型内部。直观地,我们考虑如何通过为正在评估的患者提供第二个变量的信息来影响基于第一个变量的 LLM 的相似性决策。然后,我们诱导提示级环境变化以获得不同子群体的相关估计,这使得不变因果预测(ICP)方法能够获得保守的候选父链接。我们在慢性阻塞性肺病(COPD)和多发性硬化症(MS)这两个临床领域展示了该方法。在提示环境中,引出的相关性是平滑、稳定且临床可解释的,但以支持下游不变性测试的统计显着方式变化,使得 ICP 提供一小组候选不变父链接。这些结果表明,通过三元组比较的间接启发可以从 LLM 恢复有意义的关联结构,并提供从隐式相关性到与 LLM 回答模式一致的因果陈述的谨慎途径。