论文
明显的 LLM 临床分诊失败在哪里出现?本地化多项选择格式效果
Where Do Apparent LLM Clinical Triage Failures Arise? Localizing the Multiple-Choice Format Effect
摘要
使用临床医生编写的分类小插图进行的 LLM 评估报告了在受限多项选择测试下存在大量分类不足的情况。然而,当以自由文本形式生成响应时,相同临床病例的模型性能可能会发生变化。我们测试在处理案例时或在将临床信息映射到最终答案时是否会出现这种格式效果。使用 Gemma 3 4B/12B IT 和 Qwen3-8B 中的稀疏自动编码器 (SAE) 特征,我们发现医学特征在两种格式下都对共享临床叙述有效,但在多项选择决策标记上不活跃。在两种格式下,紧急层信息都可以从带有 ROC-AUC $0.95$--$1.00$ 的晕影表示线性解码,没有显着的格式差异,但在决策词元处衰减。自然语言自动编码器的言语表达和顶级特征表征将该标记与多项选择支架相关联。在直接线性投影中,已识别的医学特征贡献为零,而支架峰值特征在两个 Gemma 模型中占未签名归因的超过 $91\%$。在行为上,多项选择是否会提高或降低性能取决于模型。选项顺序洗牌排除了简单的位置偏差,并且格式之间不同的情况通常仅相隔一层严重性。总之,这些发现在答案选择时提出了格式效应的最强相关性,同时未测量的临床表征是否也存在差异。研究存储库中提供了用于重现实验的代码和数据。 https://github.com/dafraile/SAE_mad