论文
一分,两个决定:罕见病尾部的选择性预测
One Score, Two Decisions: Selective Prediction on the Rare-Disease Tail
摘要
根据患者的临床结果,诊断系统对可能的疾病进行排名,并且必须决定何时认可其首次预测或推迟审查。这个决定通常是通过对最高分数进行阈值来做出的。对排序输出的选择性预测从两次检查开始。首先,排名器必须产生足够正确的排名靠前的预测以使目标可行。在按疾病患病率分层的 2,000 份患者记录中,8 个小型开放权重 LLM 在超罕见疾病方面最多实现 4.6% 的 Recall@1。因此,在 10% 的覆盖率下,即使现有预测的完美置信度排名也无法达到 50% 的选择性准确性。更准确的模型通过了相同的检查,表明该限制是特定于制度的。其次,信心信号必须与所做的决定相匹配。对于固定候选排名者,前两名的边距取消了候选者之间共享的成分。在仅表型的 Exomiser 上,它以 29.0% 的准确度选择了 10% 的病例,而总体准确度为 13.3%,而最高分没有提供可靠的门。然而,这种取消可能会删除检测候选列表是否包含答案所需的信息。 SciFact 检索和生物医学实体链接证实了这种区别。最后,我们证明仅未标记的分数无法确定切换到边缘是否有帮助。