论文

研究线性探针对医学 QA 中的语言语域、医学专业和语料库变化的稳健性

Investigating Linear Probe Robustness to Linguistic Register, Medical Specialty, and Corpus Shifts in Medical QA

模型评测鲁棒性、公平性与可信度评测

摘要

在 大语言模型 (LLM) 的隐藏状态上训练的线性分类器、线性探针可以标记单次前向传递中的事实错误。从几何角度来看,这意味着真假陈述沿着隐藏状态空间中的稳定方向(即真值方向)分离。先前的工作对于这是否可以概括输入变化存在分歧,但这种分歧很难解释,因为跨数据集探针转移实验同时混淆了几种输入变化。我们在医学问答(QA)中分离出三个这样的变量:写作风格(语域)、领域(医学专业)和语料库(数据集)。我们使用 500 个 MedQA 条目建立了一个基准,每个条目重写为四种风格(教科书、患者、临床笔记、口语),用临床专业进行注释,并与其他两个考试语料库(MedMCQA 和 MMLU-medical)分组,以进行跨数据集评估。探究四个开放权重 LLM (2--8B),我们发现真实方向对于写作风格(在保留的事实上平均 $Δ_\text{register} \大约 0.10$ AUROC)和医学专业($Δ_\text{specialty} \大约 0.03$)来说在很大程度上是稳健的,但在整个语料库中退化不均匀:在MMLU-医疗和 MedMCQA 上的 0.21 美元,大约是注册差距的两倍。登记结果通过第二个生成器进行复制,并延续到人工编写的患者问题中。因此,真实方向在医学领域内基本上是稳定的,但在某些语料库变化下会中断,并且问题格式无法解释这种中断,这表明线性探针恢复的信号部分与数据集结构相关,而不仅仅是与医学知识相关。