论文
超出共识:对面板表面的生物医学实体候选者进行评分以供策展人分类
Beyond Agreement: Scoring Panel-Surfaced Biomedical Entity Candidates for Curator Triage
摘要
对于现代 LLM 来说,生物医学 NER 看似简单:看似合理的生物医学提及很容易浮出水面,但语料库约定的正确性取决于注释约定、跨度边界、实体粒度和类型模式。多LLM协议是一个显着性信号,而不是语料库约定的正确性。我们引入了候选级面板输出基准,用于面板显示的候选验证,其中该单元是由明确定义的多模型面板而不是独立的提取器输出显示的对齐候选。该基准将五个公共生物医学 NER 数据集的八个 LLM 预测对齐到候选主表中。 BioConCal 是一个域内监督评分器,它通过固定候选流的推理时间无黄金协议、提及、表面可用性和文档特征来实例化该层。在域中,BioConCal 将原始一致性的 AUROC 从 0.753 提高到 0.910。在验证选择的 0.95 精度目标下,它以 0.939 的经验测试精度选择了 1,340 个候选者,而原始一致性为 293 个。这对应于候选级召回率 0.592 和语料库级召回率 0.523,而面板内行标签上限为 0.883。主要好处不是恢复每个小组成员错过的实体,而是将嘈杂的小组流重塑为更高产量的审核队列。在实体类型转换下,阈值需要目标域验证,并且精确的字符定位仍然是单独的确定性后处理步骤。