论文

超越端点收益:医学专业化的权重差分审计

Beyond Endpoint Gains: A Weight-Delta Audit of Medical Specialization

模型评测模型行为与机制分析

摘要

专科语言模型通常通过端点收益来理解:通用模型得分较低,专科模型得分较高,两者的差被视为专业化的证据。这使得所发布的更新本身在很大程度上未被审视。我们提出成对权重差分路径审计,并将其应用于两个公开的、对齐的从通用到医学专科的检查点对:Gemma-3-4B-IT到MedGemma-4B-IT,以及Qwen2.5-7B-Instruct到HuatuoGPT-o1-7B。在两对检查点中,解码器侧的完整更新都能强烈重构实测的医学基准变动(端点归一化保留率分别为0.974和1.183),使每个解码器差分成为审计的合适基底。然而这种变动并不能被干净地定位:MLP在两对中都是最强的宽泛组件家族,但混合的域外变动、10种子匹配对照以及端点锚定的回滚使得无法给出唯一的粗粒度家族解释。因此,该审计将更新级重构与组件级解释区分开来。其结论仅涉及纯文本选择题基准的变动,不涉及临床验证、修复或回路级机制。

超越端点收益:医学专业化的权重差分审计:论文配图
图1:成对检查点审计协议,以主要的 Gemma→MedGemma 配对为例说明。对每个对齐版本,我们首先检验完整的解码器侧路径能否重构实测的基准变化,然后检验组件族解释能否在匹配对照与端点回滚下成立。