论文
临床证据的强度可以从语言模型表征中恢复,但不能从其规定的等级中恢复
The strength of clinical evidence is recoverable from language model representations but not from their stated grades
摘要
大语言模型 (LLM) 越来越多地总结临床证据,其中主张的权重取决于其支持的强度。然而,这些模型传达的信心很差,并且它们从未声明的属性(例如真相)通常可以从它们的激活中读取。临床模型是否记录了与事实不同的证据强度,并在被问及时陈述它是否未经测试,并且任何此类信号都可能是词汇的。我们从六个公共来源收集了 45,134 个临床声明,将 20,611 个声明统一为三个独立框架下的四级证据等级,并测试了来自多个开发人员的 22 个本地开放权重 LLM(6 亿至 70 亿个参数;一般参数、医学参数和推理参数),并进行了词汇、事实和跨框架控制。线性估计器恢复了每个模型的等级(AUROC 中位数 71.8),但可解码性并没有随着规模的扩大而提高,并且在推理模型中最弱。模型给出的评分纯属偶然,比估计值低 25-27 个百分点。可恢复的信号主要是词汇性的,不会跨主题或框架转移,但它与事实真相不同,并且仍然标记出弱支持的主张(AUROC 69.2)。因此,临床 LLM 带有他们未表达的有序证据强度信号,因此即使可以从其陈述和文本中恢复,他们所声明的等级也无法传达主张的支持。