论文

用于解释医学预测中黑盒 LLM 的代理模型

Surrogate modeling for interpreting black-box LLMs in medical predictions

模型评测模型行为与机制分析

摘要

大语言模型 (LLM) 在大量数据集上进行训练,在其参数内编码广泛的现实世界知识,但其黑盒性质掩盖了这种编码的机制和范围。代理建模使用简化模型来近似复杂系统,可以为黑盒模型提供更好的可解释性。我们提出了一个代理建模框架,可以定量解释 LLM 编码的知识。对于源自领域知识的特定假设,该框架通过在各种模拟场景中进行广泛提示,使用可观察元素(输入输出对)来近似潜在的 LLM 知识空间。通过医学预测中的概念验证实验,我们证明了我们的框架在揭示 LLM “感知”每个输入变量相对于输出的程度方面的有效性。特别是,考虑到 LLM 可能会永久存在训练数据中的不准确性和社会偏见,我们使用该框架的实验定量地揭示了与既定医学知识相矛盾的关联以及 LLM 编码知识中科学驳斥的种族假设的持续存在。通过披露这些问题,我们的框架可以充当危险信号指示器,以支持这些模型的安全可靠的应用。