论文

MADE:多标签文本分类的活基准,具有医疗器械不良事件的不确定性量化

MADE: A Living Benchmark for Multi-Label Text Classification with Uncertainty Quantification of Medical Device Adverse Events

模型评测基准与评测资源

摘要

医疗保健等高风险领域的机器学习不仅需要强大的预测性能,还需要可靠的不确定性量化(UQ)来支持人类监督。多标签文本分类 (MLTC) 是该领域的核心任务,但由于标签不平衡、依赖性和组合复杂性,仍然具有挑战性。现有的 MLTC 基准​​日益饱和,并且可能受到训练数据污染的影响,使得很难区分真正的推理能力和记忆能力。我们推出了 MADE,这是一个实时的 MLTC 基准​​,源自{m}医疗器械{ad}verse {e}报告,并根据新发布的报告不断更新,以防止污染。 MADE 具有分层标签的长尾分布,并通过严格的时间分割实现可重复的评估。我们在 微调 和少样本设置(指令调整/推理变体、本地/API 可访问)下建立了 20 多个仅编码器和解码器模型的基线。我们系统地评估基于熵/一致性和自我语言化的 UQ 方法。结果显示出明显的权衡:较小的判别式微调解码器在保持有竞争力的 UQ 的同时实现了最强的头尾精度;生成式 微调 提供最可靠的 UQ;大型推理模型提高了稀有标签的性能,但 UQ 却出奇地弱;自我表达的信心并不能代表不确定性。我们的工作可在 https://hhi.fraunhofer.de/aml-demonstrator/made-benchmark 上公开获取。