论文

MedSNIP:为医疗事实验证构建片段级粒度并进行基准测试

MedSNIP: Building and Benchmarking Snippet-Level Granularity for Medical Fact Verification

模型评测基准与评测资源

摘要

医学声明的正确性通常不仅仅取决于该声明,还取决于其周围的临床结构。一项声明可能需要实验室参考范围、因果或条件联系或患者特定的详细信息才能正确判断,而原子级分解可以分割这些依赖性,使验证者留下临床上不完整的声明。我们围绕片段级验证重新制定医学事实检查,其中子句分组单元保留本地临床结构。我们引入了 MedSNIP-Bench(用于片段级医学事实验证的人工注释基准)和 MedSNIP(自动片段生成管道)。 MedSNIP-Bench 涵盖 276 个消费者健康和临床小插曲响应,分为 2,524 个片段,带有双重一般和住院上下文标签以及六个结构模式代码。 MedSNIP 在 MedSNIP-Bench 上根据人类片段边界进行评估,然后用于为外部语料库生成片段级单元。在 MedSNIP-Bench、HealthFC 和 MedHallu 中,片段级验证保留或改进了错误类 F1,收益集中在答案足够长以进行碎片化以及验证器足够强大以利用恢复的结构的地方。最大的合并模式增益是在因果条件临床链上。它还将验证器调用减少了 24-73%,尽管只有当分解成本较低时,这种节省才能在端到端中持续存在,而开放权重分解器可以在不损失分块保真度的情况下实现这一点。