论文

LLM中的临床概念中心

Clinical Concept Centers in LLMs

模型评测模型行为与机制分析

摘要

大语言模型日益用于临床场景,但其可靠性与性能研究几乎全部聚焦语言基底——为模型所说内容打分。机制可解释性发现潜空间携带比文本更高保真的表示:内部表示编码的内容远多于输出所言,且所陈述推理系统性地省略因果驱动答案的特征。以机制可解释性视角评估模型行为在临床决策支持中尚未被探索。本工作把行为评估扩展到潜空间,追问临床概念是否作为可定位、被因果使用的表示存在于开源LLM内部。我们在测试的全部十一个开源模型的潜空间中发现专门的临床概念中心:可解释、只在其对齐的临床叙事上激活,并在受限与开放式设置中有意义地因果驱动模型行为。它们不只是分析性表示,而是可用于临床实践的回路;我们从评估与性能两个视角探索其用途。评估角度:模型在对抗性角色启动下保持内部一致并继续使用相关概念中心,而对齐启动改善下游临床性能;性能角度:模拟现实部署设置,沿这些中心引导模型带来有意义的下游改进。最后盲法临床医生验证显示这些概念中心的激活与使用可预测临床医生的偏好。