论文
四本账本,非单一评分:生物医学机器学习中LLM判别校准的负责任传播
Four Ledgers, Not One Score: Responsible Communication of LLM-Judge Calibration in Biomedical ML
摘要
合成扰动似乎为生物医学机器学习中的LLM评估者提供了廉价的校准数据,尤其在专家评审稀缺的情况下。然而,植入的突变密钥既非检测器输出,也非自动的人类真值标签。我们形式化了四类独立账本:植入的扰动、独立检测器输出、与源关联的人类判断、以及人类新增发现。随后对一个私有合成的日本护理交接工作流的评估设计、评分代码、读取路径及现有的人类记录进行了审计。该工厂在47个目标中存储了69张植入错误卡片。最终审查覆盖了22个目标,包含22个确认导入的提案、9个被拒提案和79张人类新增卡片;仅有3个目标被双标注。将植入的密钥传递给通用检测器评分器,得到22/(22+9)=0.710和22/(22+79)=0.218。直接的审计恒等关系表明,这些数值是提案确认率和提交账本构成率,而非评审器精确率与召回率,因为现有记录中未保留任一独立检测器针对受审提案的实际输出。审计还发现源名冲突、行遮蔽、强制严重性、空值比率默认、以及不支持零支持字段权重等问题。我们提出了一个基于溯源的声明审计、一个存储合约,以及一个最低校准门限,用于负责任地传播生物医学机器学习能力声明。此单个工作流的取证案例证明了失败模式的存在,而非其普遍性:现有的人类工作支持对合成提案的探索性审计,但不支持对LLM判别性能、临床有效性、语料库普遍性或稳健的跨标注一致性进行评估。