论文

开放权重大型语言模型中的临床风险分类错位和成本不对称

Misaligned Clinical Risk Classification and Cost Asymmetry in Open-Weight Large Language Models

模型评测模型行为与机制分析

摘要

大型语言模型(LLM)如何将患者风险与临床成本权衡结合起来仍然知之甚少。我们研究了四个开放权重大语言模型(Qwen-2.5-7B/32B 和 Llama-3.1-8B/70B)如何在内部表示成本权衡,这些表示如何与临床预测相关,以及决策是否按照指定成本方向和幅度的预测发生变化。使用公共糖尿病数据集,我们改变了三个短语中 11 个假阴性 (FN) 与假阳性 (FP) 的成本比率,并检查了表征和行为输出。与传统分类器一样,患者风险是线性可恢复的(AUC $\约 0.83$),并且每个模型中的成本方向都是可恢复的。然而,成本方向的代表性转变仅在两个较大的模型中跟踪产出变化,并且对成本大小的响应主要与方向无关。 12 个模型短语中只有 2 个对增加 FN 与 FP 成本以及成本正确排序表现出相反的反应。代表性地,在一个成本侧上拟合的方向在转移到另一侧时不会反转,正如镜像对称编码下所预期的那样。这些发现表明,大语言模型对风险和成本信息进行了编码,但没有将它们可靠地整合到成本正确的决策中。因此,临床评估应包括权衡测试、措辞敏感性、默认操作点以及预测性能。